speech-recognition
speech-recognition टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #121★ 719+0पिछले 7 दिनों में स्टार का बदलाव
- #122★ 718+0पिछले 7 दिनों में स्टार का बदलाव
- #123
PyTorch-Lightning और Hydra का लाभ उठाने वाला एंड-टू-एंड स्पीच रिकग्निशन के लिए ओपन-सोर्स टूलकिट।
★ 714+0पिछले 7 दिनों में स्टार का बदलाव - #124★ 712+3पिछले 7 दिनों में स्टार का बदलाव
- #125
वॉयस API उदाहरण।
★ 708+0पिछले 7 दिनों में स्टार का बदलाव - #126
स्पीच-टू-टेक्स्ट बेंचमार्क फ्रेमवर्क
★ 697+0पिछले 7 दिनों में स्टार का बदलाव - #127
Android के लिए OpenAI Whisper और TensorFlow Lite के साथ ऑफ़लाइन वाक् पहचान (Speech Recognition)
★ 688+0पिछले 7 दिनों में स्टार का बदलाव - #128
INTERSPEECH 2023-2024 पेपर्स: INTERSPEECH 2023-24 सम्मेलन से प्रभावशाली और रोमांचक शोध पत्रों का एक संपूर्ण संग्रह। स्पीच और लैंग्वेज प्रोसेसिंग में नवीनतम प्रगति का अन्वेषण करें। कोड शामिल है।
★ 684+0पिछले 7 दिनों में स्टार का बदलाव - #129
React Native Expo प्रोजेक्ट्स के लिए स्पीच रिकग्निशन
★ 678+7पिछले 7 दिनों में स्टार का बदलाव - #130
बोले गए अंकों का एक मुफ्त ऑडियो डेटासेट। MNIST का एक ऑडियो संस्करण।
★ 678+0पिछले 7 दिनों में स्टार का बदलाव - #131
ASR, VAD, LID और Punc मॉड्यूल के साथ एक अत्याधुनिक औद्योगिक-ग्रेड ऑल-इन-वन ASR सिस्टम। FireRedASR2 चीनी (मंदारिन, 20+ बोलियों/उच्चारणों), अंग्रेजी, कोड-स्विचिंग, और भाषण और गायन दोनों ASR का समर्थन करता है। FireRedVAD 100+ भाषाओं में भाषण/गायन/संगीत का समर्थन करता है। FireRedLID 100+ भाषाओं और 20+ चीनी बोलियों का समर्थन करता है। FireRedPunc चीनी और अंग्रेजी का समर्थन करता है।
★ 672+15पिछले 7 दिनों में स्टार का बदलाव - #132★ 671+0पिछले 7 दिनों में स्टार का बदलाव
- #133★ 669+0पिछले 7 दिनों में स्टार का बदलाव
- #134
घर पर ChatGPT! LiteLLM और LangGraph का उपयोग करके Raspberry Pi पर निर्मित, कमर्शियल स्मार्ट होम असिस्टेंट का एक बेहतर विकल्प।
★ 648+1पिछले 7 दिनों में स्टार का बदलाव - #135★ 638+0पिछले 7 दिनों में स्टार का बदलाव
- #136
Whisper पर आधारित Android Input Method Editor (IME)
★ 633+7पिछले 7 दिनों में स्टार का बदलाव - #137
रीयल-टाइम ऑडियो अनुवाद, सिस्टम ऑडियो + माइक कैप्चर करता है, ASR (Whisper/SenseVoice) चलाता है, और स्ट्रीमिंग डिस्प्ले के साथ LLM API के माध्यम से अनुवाद करता है। VTubers, लाइवस्ट्रीमर्स और विदेशी सामग्री देखने के लिए उपयुक्त।
★ 626+39पिछले 7 दिनों में स्टार का बदलाव - #138
faster-whisper का उपयोग करके रियल-टाइम ट्रांसक्रिप्शन
★ 614+0पिछले 7 दिनों में स्टार का बदलाव - #139
बहुभाषी ASR और TTS मॉडल के लिए C++ ggml रनटाइम हब: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, आदि, साथ ही यूनिवर्सल फोर्स्ड अलाइनमेंट और बहुत कुछ।
★ 611+22पिछले 7 दिनों में स्टार का बदलाव - #140
शब्दकोश और भाषा मॉडल के साथ Connectionist Temporal Classification (CTC) डिकोडर।
★ 580+1पिछले 7 दिनों में स्टार का बदलाव - #141
Whisper Model के लिए एक अनुकूलित Speech-to-Text Pipeline जो कई Inference Engine का समर्थन करती है
★ 578+1पिछले 7 दिनों में स्टार का बदलाव - #142
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — React Native के लिए Alan AI SDK।
★ 575+0पिछले 7 दिनों में स्टार का बदलाव - #143
VRChat के लिए बनाया गया एक मॉड्यूलर नोड-प्रोग्रामिंग भाषा, प्रोग्राम क्रिएटर, एनिमेशन सिस्टम, टूलकिट, राउटर और डिबगर।
★ 562-2पिछले 7 दिनों में स्टार का बदलाव - #144
🗣 एक ओवरले जो आपके उपयोगकर्ता की आवाज़ की अनुमति और इनपुट को एक कस्टमाइज़ेबल UI में टेक्स्ट के रूप में प्राप्त करता है
★ 557+1पिछले 7 दिनों में स्टार का बदलाव - #145
SpeechIO लीडरबोर्ड: ऑटोमैटिक स्पीच रिकग्निशन के लिए एक बड़ा, मजबूत और व्यापक बेंचमार्किंग प्लेटफ़ॉर्म।
★ 553+3पिछले 7 दिनों में स्टार का बदलाव - #146
कोरियाई स्पीच रिकग्निशन STT API सूची और उनके प्रदर्शन बेंचमार्क।
★ 547+1पिछले 7 दिनों में स्टार का बदलाव - #147
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 541+15पिछले 7 दिनों में स्टार का बदलाव - #148★ 540-1पिछले 7 दिनों में स्टार का बदलाव
- #149
Automatic Speech Recognition (ASR) और Text-To-Speech (TTS) इंजन। चीनी और अंग्रेजी स्पीच रिकग्निशन, मल्टी-रोल स्पीच सिंथेसिस, बहुभाषी समर्थन और उच्च सटीकता।
★ 530+2पिछले 7 दिनों में स्टार का बदलाव - #150
Vosk के WebAssembly बिल्ड की मदद से ब्राउज़र में चलने वाली एक स्पीच रिकग्निशन लाइब्रेरी।
★ 529+1पिछले 7 दिनों में स्टार का बदलाव