speech-to-text
speech-to-text टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #121
ऑडियो AI में लार्ज लैंग्वेज मॉडल्स (LLMs) के अनुप्रयोगों पर संसाधनों का संग्रह
★ 738+0पिछले 7 दिनों में स्टार का बदलाव - #122
Pytorch में कार्यान्वित स्ट्रीमिंग और नॉन-स्ट्रीमिंग ऑटोमैटिक स्पीच रिकग्निशन फ्रेमवर्क, जो ऑनलाइन और ऑफलाइन रिकग्निशन के साथ संगत है, वर्तमान में Conformer, Squeezeformer, और DeepSpeech2 मॉडल का समर्थन करता है और विभिन्न डेटा ऑगमेंटेशन विधियों के साथ आता है।
★ 727+0पिछले 7 दिनों में स्टार का बदलाव - #123
Rapida एक ओपन-सोर्स, एंड-टू-एंड वॉयस AI ऑर्केस्ट्रेशन प्लेटफ़ॉर्म है, जो ऑडियो स्ट्रीमिंग, STT, TTS, VAD, मल्टी-चैनल इंटीग्रेशन, एजेंट स्टेट मैनेजमेंट और ऑब्जर्वेबिलिटी के साथ रीयल-टाइम संवादात्मक वॉयस एजेंट बनाने के लिए है।
★ 723+4पिछले 7 दिनों में स्टार का बदलाव - #124★ 719+0पिछले 7 दिनों में स्टार का बदलाव
- #125★ 718-1पिछले 7 दिनों में स्टार का बदलाव
- #126
वॉयस API उदाहरण।
★ 707-1पिछले 7 दिनों में स्टार का बदलाव - #127
स्पीच-टू-टेक्स्ट बेंचमार्क फ्रेमवर्क
★ 698+1पिछले 7 दिनों में स्टार का बदलाव - #128
वीडियो से सबटाइटल (SRT) निकालने और उन्हें किसी भी भाषा में अनुवाद करने के लिए एक मुफ्त, स्थानीय डेस्कटॉप ऐप — असीमित उपयोग, कोई साइनअप नहीं, कोई क्लाउड नहीं।
★ 684+15पिछले 7 दिनों में स्टार का बदलाव - #129
React Native Expo प्रोजेक्ट्स के लिए स्पीच रिकग्निशन
★ 678+4पिछले 7 दिनों में स्टार का बदलाव - #130
Whisper और LLM (GPT, Claude, आदि) का उपयोग करके आवाज़ को ट्रांसक्रिप्ट और LRC फ़ाइल में अनुवाद करें।
★ 675+0पिछले 7 दिनों में स्टार का बदलाव - #131★ 671+0पिछले 7 दिनों में स्टार का बदलाव
- #132★ 638+0पिछले 7 दिनों में स्टार का बदलाव
- #133
ऑनलाइन प्रॉक्टरिंग में स्वचालित निगरानी के लिए सॉफ़्टवेयर बनाना
★ 634-1पिछले 7 दिनों में स्टार का बदलाव - #134
Apple Silicon Mac के लिए तेज़, निजी, स्थानीय-प्रथम वॉइस ऐप — श्रुतलेख, फ़ाइल/मीडिया प्रतिलेखन, मीटिंग रिकॉर्डिंग, ट्रांसफ़ॉर्म, और एक सार्वजनिक स्वचालन CLI। मुफ़्त और ओपन-सोर्स।
★ 630+14पिछले 7 दिनों में स्टार का बदलाव - #135
WhisperKit के साथ स्थानीय स्पीच-टू-टेक्स्ट का उपयोग करने वाला एक मूल macOS मेनू बार डिक्टेशन ऐप
★ 620+1पिछले 7 दिनों में स्टार का बदलाव - #136
बहुभाषी ASR और TTS मॉडल के लिए C++ ggml रनटाइम हब: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, आदि, साथ ही यूनिवर्सल फोर्स्ड अलाइनमेंट और बहुत कुछ।
★ 614+11पिछले 7 दिनों में स्टार का बदलाव - #137
faster-whisper का उपयोग करके रियल-टाइम ट्रांसक्रिप्शन
★ 614+0पिछले 7 दिनों में स्टार का बदलाव - #138
Vosk लाइब्रेरी का उपयोग करके Android के लिए एक ओपन-सोर्स ऑन-डिवाइस वॉयस IME (कीबोर्ड)।
★ 582+3पिछले 7 दिनों में स्टार का बदलाव - #139
Playwright के साथ reCAPTCHA v2 और v3 को हल करने के लिए एक Python लाइब्रेरी।
★ 579+3पिछले 7 दिनों में स्टार का बदलाव - #140
Whisper Model के लिए एक अनुकूलित Speech-to-Text Pipeline जो कई Inference Engine का समर्थन करती है
★ 578+0पिछले 7 दिनों में स्टार का बदलाव - #141
VRChat के लिए बनाया गया एक मॉड्यूलर नोड-प्रोग्रामिंग भाषा, प्रोग्राम क्रिएटर, एनिमेशन सिस्टम, टूलकिट, राउटर और डिबगर।
★ 563+0पिछले 7 दिनों में स्टार का बदलाव - #142
🗣 एक ओवरले जो आपके उपयोगकर्ता की आवाज़ की अनुमति और इनपुट को एक कस्टमाइज़ेबल UI में टेक्स्ट के रूप में प्राप्त करता है
★ 557+1पिछले 7 दिनों में स्टार का बदलाव - #143
कोरियाई स्पीच रिकग्निशन STT API सूची और उनके प्रदर्शन बेंचमार्क।
★ 547+0पिछले 7 दिनों में स्टार का बदलाव - #144
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 547+22पिछले 7 दिनों में स्टार का बदलाव - #145
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 544+11पिछले 7 दिनों में स्टार का बदलाव - #146
Vosk के WebAssembly बिल्ड की मदद से ब्राउज़र में चलने वाली एक स्पीच रिकग्निशन लाइब्रेरी।
★ 529+1पिछले 7 दिनों में स्टार का बदलाव - #147
Phonetisaurus G2P
★ 521-1पिछले 7 दिनों में स्टार का बदलाव - #148
यह टूल आपके उच्चारण का मूल्यांकन करने के लिए AI का उपयोग करता है।
★ 518+1पिछले 7 दिनों में स्टार का बदलाव - #149
ओपन-सोर्स ऑडियो और वीडियो ट्रांसक्रिप्शन सॉफ़्टवेयर
★ 515+0पिछले 7 दिनों में स्टार का बदलाव - #150
ओपन सोर्स, लोकल और सेल्फ-होस्टेड अत्यधिक अनुकूलित लैंग्वेज इन्फरेंस सर्वर, जो WebRTC, REST और WS पर ASR/STT, TTS और LLM का समर्थन करता है।
★ 512+0पिछले 7 दिनों में स्टार का बदलाव