speech-to-text
speech-to-text टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
ओपन सोर्स वॉयस AI प्लेटफॉर्म। Vapi और Retell का सेल्फ-होस्टेड विकल्प। ऑन-प्रेम, स्पीच-टू-स्पीच या LLM/STT/TTS में BYOK, विजुअल वर्कफ्लो बिल्डर, MCP नेटिव और टेलीफोनी सहायता के साथ।
★ 5,568+0पिछले 7 दिनों में स्टार का बदलाव - #32
ओपन-सोर्स AI वीडियो लोकलाइजेशन टूल: YouTube/Bilibili वीडियो डाउनलोड, उपशीर्षक पहचान और अनुवाद, वॉयस क्लोनिंग डबिंग, ऑडियो ट्रैक मिक्सिंग और उपशीर्षक बर्निंग को स्वचालित रूप से पूरा करता है।
★ 5,404+0पिछले 7 दिनों में स्टार का बदलाव - #33
वॉयस रिकग्निशन टू टेक्स्ट टूल / एक ऑफ़लाइन चलने वाला स्थानीय ऑडियो-वीडियो से सबटाइटल टूल, जो json, srt सबटाइटल और सादे पाठ प्रारूप में आउटपुट देता है
★ 4,780+0पिछले 7 दिनों में स्टार का बदलाव - #34
TPU पर 70x तक की गति बढ़ाने के लिए OpenAI के Whisper मॉडल का JAX कार्यान्वयन।
★ 4,679+0पिछले 7 दिनों में स्टार का बदलाव - #35★ 4,624+0पिछले 7 दिनों में स्टार का बदलाव
- #36
ऑन-डिवाइस उपशीर्षक निर्माण जो सीधे DaVinci Resolve, Premiere और After Effects से जुड़ता है।
★ 4,122+0पिछले 7 दिनों में स्टार का बदलाव - #37
Windows LiveCaptions पर आधारित एक हल्का और शक्तिशाली रीयल-टाइम ऑडियो/स्पीच ट्रांसलेशन टूल।
★ 3,637+0पिछले 7 दिनों में स्टार का बदलाव - #38
एक कुंजी दबाकर रखें, बोलें, छोड़ें — किसी भी ऐप में आपके कर्सर पर AI-पॉलिश किया हुआ टेक्स्ट दिखाई देता है। macOS और Windows के लिए ओपन-सोर्स वॉयस इनपुट।
★ 3,403+0पिछले 7 दिनों में स्टार का बदलाव - #39
OpenAI Whisper ASR वेबसर्विस API
★ 3,328+0पिछले 7 दिनों में स्टार का बदलाव - #40
Whisper और Faster-Whisper के स्टैंडअलोन निष्पादन योग्य (executables) उन लोगों के लिए जो Python के झंझट में नहीं पड़ना चाहते।
★ 3,171+0पिछले 7 दिनों में स्टार का बदलाव - #41
LLaMA-Omni, Llama-3.1-8B-Instruct पर आधारित एक कम-विलंबता और उच्च-गुणवत्ता वाला एंड-टू-एंड स्पीच इंटरेक्शन मॉडल है, जिसका उद्देश्य GPT-4o स्तर की स्पीच क्षमताएं प्राप्त करना है।
★ 3,147+0पिछले 7 दिनों में स्टार का बदलाव - #42
ओपन सोर्स, स्थानीय और सेल्फ-होस्टेड Amazon Echo/Google Home का प्रतिस्पर्धी वॉयस असिस्टेंट विकल्प
★ 3,101+0पिछले 7 दिनों में स्टार का बदलाव - #43
वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!
★ 3,068+0पिछले 7 दिनों में स्टार का बदलाव - #44★ 2,864+0पिछले 7 दिनों में स्टार का बदलाव
- #45
शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)
★ 2,842+0पिछले 7 दिनों में स्टार का बदलाव - #46
Google Meet, Microsoft Teams और Zoom के लिए ओपन-सोर्स मीटिंग ट्रांसक्रिप्शन API। ऑटो-जॉइन बॉट्स, रियल-टाइम WebSocket ट्रांसक्रिप्ट, AI एजेंटों के लिए MCP सर्वर। सेल्फ-होस्ट करें या होस्टेड SaaS का उपयोग करें।
★ 2,741+0पिछले 7 दिनों में स्टार का बदलाव - #47
आपके ऐप्स में फ्रंटियर CoreML ऑडियो मॉडल — टेक्स्ट-टू-स्पीच, स्पीच-टू-टेक्स्ट, वॉयस एक्टिविटी डिटेक्शन, और स्पीकर डायरिज़ेशन। Swift में, SOTA ओपन सोर्स द्वारा संचालित।
★ 2,723+0पिछले 7 दिनों में स्टार का बदलाव - #48
Cluely का ओपन सोर्स विकल्प - एक बिजली की तरह तेज़, गोपनीयता-प्रथम AI सहायक जो मीटिंग्स, इंटरव्यू और बातचीत के दौरान किसी को पता चले बिना सहजता से काम करता है। नेटिव प्रदर्शन के लिए Tauri के साथ निर्मित, केवल 10MB। वीडियो कॉल, स्क्रीन शेयर और रिकॉर्डिंग में पूरी तरह से अदृश्य।
★ 2,619+0पिछले 7 दिनों में स्टार का बदलाव - #49
🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।
★ 2,606+0पिछले 7 दिनों में स्टार का बदलाव - #50★ 2,537+0पिछले 7 दिनों में स्टार का बदलाव
- #51
🔊 Whisper के लिए शानदार सूची — OpenAI द्वारा विकसित एक ओपन-सोर्स AI-संचालित वाक् पहचान प्रणाली
★ 2,375+0पिछले 7 दिनों में स्टार का बदलाव - #52
अपनी स्क्रीन रिकॉर्ड करें, डेमो शिप करें। निःशुल्क और ओपन-सोर्स, GPU-त्वरित, कोई वॉटरमार्क नहीं, कोई सब्सक्रिप्शन नहीं। Windows, macOS, Linux। सक्रिय रूप से मेंटेन किया गया।
★ 2,287+0पिछले 7 दिनों में स्टार का बदलाव - #53
ओपन-सोर्स और मुफ़्त Wispr Flow विकल्प | FunASR स्थानीय मॉडल और कॉन्फ़िगर करने योग्य LLM को एकीकृत करने वाला अगली पीढ़ी का चीनी डेस्कटॉप वॉइस वर्कफ़्लो
★ 2,278+0पिछले 7 दिनों में स्टार का बदलाव - #54
ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।
★ 2,214+0पिछले 7 दिनों में स्टार का बदलाव - #55
ASR/STT उपशीर्षक जनरेटर। Qwen3-ASR, स्थानीय LLM, Whisper, TEN-VAD का उपयोग करता है। JAV के लिए शोर-रोधी
★ 2,196+0पिछले 7 दिनों में स्टार का बदलाव - #56
tensorflow डीप लर्निंग फ्रेमवर्क, सीक्वेंस-टू-सीक्वेंस न्यूरल नेटवर्क का उपयोग करके 🎙 स्पीच रिकग्निशन
★ 2,173+0पिछले 7 दिनों में स्टार का बदलाव - #57★ 2,170+0पिछले 7 दिनों में स्टार का बदलाव
- #58★ 2,046+0पिछले 7 दिनों में स्टार का बदलाव
- #59★ 1,892+0पिछले 7 दिनों में स्टार का बदलाव
- #60
16+ मॉडल परिवारों के लिए ggml स्पीच-टू-टेक्स्ट अनुमान
★ 1,872+0पिछले 7 दिनों में स्टार का बदलाव