speech-recognition
speech-recognition टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #91
ऑडियो AI अनुसंधान के लिए हब: ऑडियो LLMs, स्पीच रिकग्निशन, TTS, संगीत और ऑडियो जनरेशन पर शोध पत्र, ओपन मॉडल, बेंचमार्क और डेटासेट।
★ 953+3पिछले 7 दिनों में स्टार का बदलाव - #92
llm सारांश के साथ टर्नकी सेल्फ-होस्टेड ऑफ़लाइन ट्रांसक्रिप्शन और डायरीज़ेशन सेवा
★ 948+2पिछले 7 दिनों में स्टार का बदलाव - #93
Whisper.net। Whisper मॉडल का उपयोग करके स्पीच टू टेक्स्ट को आसान बनाया गया।
★ 941+1पिछले 7 दिनों में स्टार का बदलाव - #94★ 939+0पिछले 7 दिनों में स्टार का बदलाव
- #95
पायथन आधारित डेस्कटॉप वॉयस असिस्टेंट जो सिस्टम-स्तरीय कमांड निष्पादित करने, स्पीच रिकग्निशन और टेक्स्ट-टू-स्पीच को एकीकृत करने और एसिंक्रोनस उपयोगकर्ता इंटरैक्शन को संभालने में सक्षम है।
★ 920+14पिछले 7 दिनों में स्टार का बदलाव - #96
स्ट्रीमिंग और ऑन-डिवाइस उपयोग के लिए ऑप्टिमाइज़्ड Whisper मॉडल
★ 897+0पिछले 7 दिनों में स्टार का बदलाव - #97
एक टॉकिंग LLM जो बिना इंटरनेट के आपके कंप्यूटर पर चलता है।
★ 891+2पिछले 7 दिनों में स्टार का बदलाव - #98
SpeechPy - स्पीच प्रोसेसिंग और रिकग्निशन के लिए एक लाइब्रेरी: http://speechpy.readthedocs.io/en/latest/
★ 883+0पिछले 7 दिनों में स्टार का बदलाव - #99
PaddlePaddle पर आधारित एंड-टू-एंड चीनी वॉयस रिकग्निशन, शुरुआती से लेकर व्यावहारिक प्रोजेक्ट्स तक। DeepSpeech2, Conformer और Squeezeformer मॉडल्स का समर्थन करता है।
★ 870-1पिछले 7 दिनों में स्टार का बदलाव - #100
💬 आपके React ऐप के लिए स्पीच रिकग्निशन
★ 842+1पिछले 7 दिनों में स्टार का बदलाव - #101
Connectionist Temporal Classification (CTC) डिकोडिंग एल्गोरिदम: बेस्ट पाथ, बीम सर्च, लेक्सिकॉन सर्च, प्रीफिक्स सर्च और टोकन पासिंग। Python में कार्यान्वित।
★ 836-1पिछले 7 दिनों में स्टार का बदलाव - #102
OpenAI के Whisper का उपयोग करके रीयल-टाइम speech2text वेब ऐप्स बनाएं https://openai.com/blog/whisper/
★ 835+0पिछले 7 दिनों में स्टार का बदलाव - #103★ 823-1पिछले 7 दिनों में स्टार का बदलाव
- #104
Linux के लिए मुफ्त, ओपन-सोर्स, 100% ऑफ़लाइन वॉयस डिक्टेशन। whisper.cpp, Whisper और VOSK इंजन के माध्यम से कहीं भी बोलें और टाइप करें, GPU-त्वरित, X11 + Wayland पर काम करता है!
★ 808+23पिछले 7 दिनों में स्टार का बदलाव - #105
🎤 Lobe TTS - सर्वर और ब्राउज़र के लिए एक उच्च-गुणवत्ता और विश्वसनीय TTS/STT लाइब्रेरी
★ 805+1पिछले 7 दिनों में स्टार का बदलाव - #106
Speech to Text to Speech। गाना अभी चल रहा है। अवतार पर प्रदर्शित करने के लिए टेक्स्ट को OSC संदेशों के रूप में VRChat पर भेजता है। (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 803+4पिछले 7 दिनों में स्टार का बदलाव - #107
whisper.cpp की React Native बाइंडिंग।
★ 801+0पिछले 7 दिनों में स्टार का बदलाव - #108★ 789+20पिछले 7 दिनों में स्टार का बदलाव
- #109
Ollama, Hugging Face Transformers और Coqui TTS टूलकिट द्वारा संचालित आकर्षक बातचीत के लिए लोकल वॉयस चैटबॉट।
★ 788+1पिछले 7 दिनों में स्टार का बदलाव - #110
एक प्रोजेक्ट जो OpenAI whisper के साथ माइक्रोफ़ोन का उपयोग करने की अनुमति देता है।
★ 787+0पिछले 7 दिनों में स्टार का बदलाव - #111
Swift में ऑडियो ट्रांसक्राइब करने का सबसे आसान तरीका।
★ 785-1पिछले 7 दिनों में स्टार का बदलाव - #112
एक 100% निजी AI वॉइस ट्रांसक्रिप्शन ऐप जो 100+ भाषाओं में भाषण को टेक्स्ट में बदलता है। पूर्ण गोपनीयता के लिए बिना किसी क्लाउड अपलोड के Whisper AI का उपयोग करके Android और iOS के लिए Compose Multiplatform के साथ निर्मित।
★ 777+1पिछले 7 दिनों में स्टार का बदलाव - #113
चीनी अंकों और अरबी अंकों के बीच त्वरित रूपांतरण (नवीनतम सुविधाएँ: भिन्न, दिनांक, तापमान आदि का रूपांतरण)।
★ 766+0पिछले 7 दिनों में स्टार का बदलाव - #114
PaddlePaddle पर आधारित वाक् पहचान (Speech Recognition), चीनी वाक् पहचान। परियोजना परिपक्व है और पहचान प्रभाव अच्छा है। Windows और Linux के तहत प्रशिक्षण और पूर्वानुमान का समर्थन करता है, और Nvidia Jetson विकास बोर्ड पूर्वानुमान का समर्थन करता है।
★ 763+1पिछले 7 दिनों में स्टार का बदलाव - #115★ 762+0पिछले 7 दिनों में स्टार का बदलाव
- #116★ 754+2पिछले 7 दिनों में स्टार का बदलाव
- #117
Unity3d में स्थानीय मशीन पर स्पीच-टू-टेक्स्ट मॉडल (whisper.cpp) चलाना।
★ 751+1पिछले 7 दिनों में स्टार का बदलाव - #118
Allosaurus 2000 से अधिक भाषाओं के लिए एक प्रीट्रेन्ड यूनिवर्सल फोन रिकॉग्नाइज़र है
★ 746+4पिछले 7 दिनों में स्टार का बदलाव - #119
Android के लिए प्राइवेट और ऑन-डिवाइस स्पीच रिकग्निशन कीबोर्ड और सर्विस।
★ 745+6पिछले 7 दिनों में स्टार का बदलाव - #120
Pytorch में कार्यान्वित स्ट्रीमिंग और नॉन-स्ट्रीमिंग ऑटोमैटिक स्पीच रिकग्निशन फ्रेमवर्क, जो ऑनलाइन और ऑफलाइन रिकग्निशन के साथ संगत है, वर्तमान में Conformer, Squeezeformer, और DeepSpeech2 मॉडल का समर्थन करता है और विभिन्न डेटा ऑगमेंटेशन विधियों के साथ आता है।
★ 727+0पिछले 7 दिनों में स्टार का बदलाव