speech-recognition
speech-recognition टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर speech-recognition के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और speech-recognition टैग वाली रिपॉजिटरी।
- #1
एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम
★ 2,362 - #2
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 541 - #3
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #4
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
🤗 Transformers: टेक्स्ट, विज़न, ऑडियो और मल्टीमॉडल मॉडल में अत्याधुनिक मशीन लर्निंग मॉडल के लिए मॉडल-परिभाषा फ्रेमवर्क, जो इंफरेंस और ट्रेनिंग दोनों के लिए है।
★ 1,64,731+119पिछले 7 दिनों में स्टार का बदलाव - #2
C/C++ में OpenAI के Whisper मॉडल का पोर्ट
★ 53,389+103पिछले 7 दिनों में स्टार का बदलाव - #3
CTranslate2 के साथ तेज़ Whisper ट्रांसक्रिप्शन
★ 25,206+71पिछले 7 दिनों में स्टार का बदलाव - #4★ 23,864+61पिछले 7 दिनों में स्टार का बदलाव
- #5
ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।
★ 20,136+64पिछले 7 दिनों में स्टार का बदलाव - #6★ 17,476+1पिछले 7 दिनों में स्टार का बदलाव
- #7★ 15,474+3पिछले 7 दिनों में स्टार का बदलाव
- #8
Python, Java, C# और Node के साथ Android, iOS, Raspberry Pi और सर्वर के लिए ऑफ़लाइन स्पीच रिकग्निशन API
★ 15,101+17पिछले 7 दिनों में स्टार का बदलाव - #9
मॉडलों द्वारा आयोजित अत्याधुनिक Deep Learning स्क्रिप्ट - एंटरप्राइज़-ग्रेड बुनियादी ढांचे पर पुनरुत्पादित सटीकता और प्रदर्शन के साथ प्रशिक्षित और तैनात करने में आसान।
★ 14,846+4पिछले 7 दिनों में स्टार का बदलाव - #10
इन रोमांचक व्याख्यानों से सीखकर डीप लर्निंग, सुदृढीकरण लर्निंग, मशीन लर्निंग, कंप्यूटर विजन और NLP में डूब जाएं!!
★ 12,939+3पिछले 7 दिनों में स्टार का बदलाव - #11
क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।
★ 12,730+54पिछले 7 दिनों में स्टार का बदलाव - #12
उपयोग में आसान स्पीच टूलकिट जिसमें सेल्फ-सुपरवाइज्ड लर्निंग मॉडल, विराम चिह्नों के साथ SOTA/स्ट्रीमिंग ASR, टेक्स्ट फ्रंटएंड के साथ स्ट्रीमिंग TTS, स्पीकर वेरिफिकेशन सिस्टम, एंड-टू-एंड स्पीच ट्रांसलेशन और कीवर्ड स्पॉटिंग शामिल है। NAACL2022 बेस्ट डेमो अवार्ड जीता।
★ 12,676+5पिछले 7 दिनों में स्टार का बदलाव - #13
PyTorch पर आधारित एक स्पीच टूलकिट।
★ 11,802+10पिछले 7 दिनों में स्टार का बदलाव - #14
स्ट्रीमिंग ASR, स्पीकर डायरिज़ेशन, अनुवाद और OpenAI/Deepgram-संगत API के साथ रीयल-टाइम, स्थानीय स्पीच-टू-टेक्स्ट।
★ 10,990+16पिछले 7 दिनों में स्टार का बदलाव - #15
OpenVINO™ AI इन्फरेंस को ऑप्टिमाइज़ और डिप्लॉय करने के लिए एक ओपन सोर्स टूलकिट है।
★ 10,793+30पिछले 7 दिनों में स्टार का बदलाव - #16★ 9,949+3पिछले 7 दिनों में स्टार का बदलाव
- #17
मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।
★ 9,209+37पिछले 7 दिनों में स्टार का बदलाव - #18
Python के लिए स्पीच रिकग्निशन मॉड्यूल, जो कई इंजन और API, ऑनलाइन और ऑफलाइन का समर्थन करता है
★ 8,987+0पिछले 7 दिनों में स्टार का बदलाव - #19
एक गहरे-अधिगम-आधारित चीनी वाक् पहचान प्रणाली
★ 8,386+0पिछले 7 दिनों में स्टार का बदलाव - #20
Apple के MLX फ्रेमवर्क पर बनी एक टेक्स्ट-टू-स्पीच (TTS), स्पीच-टू-टेक्स्ट (STT) और स्पीच-टू-स्पीच (STS) लाइब्रेरी, जो Apple Silicon पर कुशल भाषण विश्लेषण प्रदान करती है।
★ 7,826+23पिछले 7 दिनों में स्टार का बदलाव - #21★ 6,815-1पिछले 7 दिनों में स्टार का बदलाव
- #22
Facebook AI Research का स्वचालित वाक् पहचान टूलकिट
★ 6,437+1पिछले 7 दिनों में स्टार का बदलाव - #23
Apple Silicon के लिए ऑन-डिवाइस स्पीच AI
★ 6,353+8पिछले 7 दिनों में स्टार का बदलाव - #24★ 6,254+3पिछले 7 दिनों में स्टार का बदलाव
- #25
लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।
★ 6,210+13पिछले 7 दिनों में स्टार का बदलाव - #26
OpenAI Whisper के आधार पर स्पीकर डायरीज़ेशन के साथ स्वचालित वाक् पहचान
★ 5,634+1पिछले 7 दिनों में स्टार का बदलाव - #27★ 5,229+1पिछले 7 दिनों में स्टार का बदलाव
- #28★ 4,928+3पिछले 7 दिनों में स्टार का बदलाव
- #29★ 4,927+5पिछले 7 दिनों में स्टार का बदलाव
- #30
वॉयस रिकग्निशन टू टेक्स्ट टूल / एक ऑफ़लाइन चलने वाला स्थानीय ऑडियो-वीडियो से सबटाइटल टूल, जो json, srt सबटाइटल और सादे पाठ प्रारूप में आउटपुट देता है
★ 4,780+9पिछले 7 दिनों में स्टार का बदलाव