speech-recognition
speech-recognition टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
TPU पर 70x तक की गति बढ़ाने के लिए OpenAI के Whisper मॉडल का JAX कार्यान्वयन।
★ 4,679-1पिछले 7 दिनों में स्टार का बदलाव - #32
एक छोटा वाक् पहचानकर्ता
★ 4,337+2पिछले 7 दिनों में स्टार का बदलाव - #33
स्पीच रिकग्निशन के लिए Whisper का डिस्टिल्ड वेरिएंट। 6 गुना तेज़, 50% छोटा, 1% शब्द त्रुटि दर के भीतर।
★ 4,114+2पिछले 7 दिनों में स्टार का बदलाव - #34
OpenAI Whisper ASR वेबसर्विस API
★ 3,328+2पिछले 7 दिनों में स्टार का बदलाव - #35
Whisper और Faster-Whisper के स्टैंडअलोन निष्पादन योग्य (executables) उन लोगों के लिए जो Python के झंझट में नहीं पड़ना चाहते।
★ 3,171+2पिछले 7 दिनों में स्टार का बदलाव - #36
ओपन सोर्स, स्थानीय और सेल्फ-होस्टेड Amazon Echo/Google Home का प्रतिस्पर्धी वॉयस असिस्टेंट विकल्प
★ 3,101+1पिछले 7 दिनों में स्टार का बदलाव - #37
वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!
★ 3,068+2पिछले 7 दिनों में स्टार का बदलाव - #38★ 2,864+0पिछले 7 दिनों में स्टार का बदलाव
- #39
शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)
★ 2,842+1पिछले 7 दिनों में स्टार का बदलाव - #40
🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।
★ 2,606+1पिछले 7 दिनों में स्टार का बदलाव - #41
एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम
★ 2,362+68पिछले 7 दिनों में स्टार का बदलाव - #42
tensorflow डीप लर्निंग फ्रेमवर्क, सीक्वेंस-टू-सीक्वेंस न्यूरल नेटवर्क का उपयोग करके 🎙 स्पीच रिकग्निशन
★ 2,173+0पिछले 7 दिनों में स्टार का बदलाव - #43★ 2,048+7पिछले 7 दिनों में स्टार का बदलाव
- #44
मंदारिन, चीनी बोलियों और अंग्रेजी का समर्थन करने वाले ओपन-सोर्स इंडस्ट्रियल-ग्रेड ASR मॉडल, सार्वजनिक मंदारिन ASR बेंचमार्क पर एक नया SOTA हासिल करते हैं, साथ ही उत्कृष्ट गायन गीत पहचान क्षमता भी प्रदान करते हैं।
★ 1,975+2पिछले 7 दिनों में स्टार का बदलाव - #45★ 1,968+0पिछले 7 दिनों में स्टार का बदलाव
- #46★ 1,935+1पिछले 7 दिनों में स्टार का बदलाव
- #47
अद्भुत स्पीकर डायरिज़ेशन पेपर, लाइब्रेरी, डेटासेट और अन्य संसाधनों की एक क्यूरेटेड सूची।
★ 1,894+1पिछले 7 दिनों में स्टार का बदलाव - #48
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — iOS के लिए Alan AI SDK
★ 1,878-3पिछले 7 दिनों में स्टार का बदलाव - #49
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Android के लिए Alan AI SDK
★ 1,807-1पिछले 7 दिनों में स्टार का बदलाव - #50
क्रॉस-प्लेटफ़ॉर्म, GPU त्वरित Whisper 🏎️
★ 1,794+0पिछले 7 दिनों में स्टार का बदलाव - #51
इंटरनेट कनेक्शन के बिना ncnn के साथ अगली पीढ़ी के Kaldi का उपयोग करके वास्तविक समय वाक् पहचान और वॉयस गतिविधि का पता लगाना (VAD)। iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A आदि का समर्थन करता है।
★ 1,777-1पिछले 7 दिनों में स्टार का बदलाव - #52
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Flutter के लिए Alan AI SDK
★ 1,756-1पिछले 7 दिनों में स्टार का बदलाव - #53
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Ionic के लिए Alan AI SDK
★ 1,649-1पिछले 7 दिनों में स्टार का बदलाव - #54
Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।
★ 1,622+8पिछले 7 दिनों में स्टार का बदलाव - #55
AI का उपयोग करके स्थानीय भाषण पहचान और कैप्शनिंग के लिए OBS प्लगइन
★ 1,597+8पिछले 7 दिनों में स्टार का बदलाव - #56
Amica वॉयस सिंथेसिस और स्पीच रिकग्निशन के साथ 3D कैरेक्टर के साथ इंटरैक्टिव संचार के लिए एक ओपन सोर्स इंटरफ़ेस है।
★ 1,591-2पिछले 7 दिनों में स्टार का बदलाव - #57
कस्टम नोड्स जो Comfyui की क्षमताओं का विस्तार करते हैं।
★ 1,525+1पिछले 7 दिनों में स्टार का बदलाव - #58★ 1,521+3पिछले 7 दिनों में स्टार का बदलाव
- #59
चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।
★ 1,512+10पिछले 7 दिनों में स्टार का बदलाव - #60★ 1,449+0पिछले 7 दिनों में स्टार का बदलाव