asr
asr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
इंटरनेट कनेक्शन के बिना ncnn के साथ अगली पीढ़ी के Kaldi का उपयोग करके वास्तविक समय वाक् पहचान और वॉयस गतिविधि का पता लगाना (VAD)। iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A आदि का समर्थन करता है।
★ 1,777-1पिछले 7 दिनों में स्टार का बदलाव - #32
Bailing GPT-4o जैसा एक语音对话机器人 है, जो ASR+LLM+TTS के माध्यम से महसूस किया जाता है, DeepSeek R1 जैसे उत्कृष्ट बड़े मॉडल को एकीकृत करता है, openClaw तक पहुंचता है, एक सच्चा व्यक्तिगत语音 सहायक है, विलंबता 800ms जितनी कम है, Mac जैसे कम-कॉन्फ़िगरेशन वाले डिवाइस भी चल सकते हैं, और रुकावट का समर्थन करता है।
★ 1,759+2पिछले 7 दिनों में स्टार का बदलाव - #33
Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।
★ 1,622+8पिछले 7 दिनों में स्टार का बदलाव - #34
LLMs, कंप्यूटर विज़न और ऑटोमैटिक स्पीच रिकग्निशन का उपयोग करके वीडियो का विश्लेषण करें
★ 1,570+8पिछले 7 दिनों में स्टार का बदलाव - #35
🎙️ AI डिक्टेशन ऐप - ओपन सोर्स और लोकल-फर्स्ट ⚡ 3x तेजी से टाइप करें, कीबोर्ड की आवश्यकता नहीं। 🆓 ओपन सोर्स मॉडल द्वारा संचालित, ऑफ़लाइन काम करता है, तेज़ और सटीक।
★ 1,520+8पिछले 7 दिनों में स्टार का बदलाव - #36
चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।
★ 1,512+10पिछले 7 दिनों में स्टार का बदलाव - #37
🍦 Speech-AI-Forge एक प्रोजेक्ट है जिसे TTS जनरेशन मॉडल के चारों ओर विकसित किया गया है, जो एक API सर्वर और Gradio-आधारित WebUI को लागू करता है।
★ 1,418+0पिछले 7 दिनों में स्टार का बदलाव - #38
वीडियो के लिए सिंक्रोनाइज्ड ट्रांसलेशन। वीडियो डबिंग
★ 1,413+2पिछले 7 दिनों में स्टार का बदलाव - #39
नियंत्रित ट्रांसक्रिप्शन। शब्द-स्तर के टाइमस्टैम्प के साथ सटीक (प्रत्येक फिलर, विराम, हकलाना, स्वर ध्वनि) या इच्छित (वक्ता क्या कहना चाहता था, पठनीयता के लिए अनुकूलित)।
★ 1,371+13पिछले 7 दिनों में स्टार का बदलाव - #40★ 1,347+6पिछले 7 दिनों में स्टार का बदलाव
- #41
रीयल-टाइम वॉयस इंटरैक्टिव डिजिटल ह्यूमन, कस्टमाइज़ करने योग्य रूप और आवाज़, वॉयस क्लोनिंग का समर्थन करता है, जिसमें प्रारंभिक पैकेज विलंबता 3s जितनी कम है।
★ 1,303-1पिछले 7 दिनों में स्टार का बदलाव - #42
StreamSpeech ऑफ़लाइन और एक साथ स्पीच रिकग्निशन, स्पीच ट्रांसलेशन और स्पीच सिंथेसिस के लिए एक "ऑल इन वन" सीमलेस मॉडल है।
★ 1,288+0पिछले 7 दिनों में स्टार का बदलाव - #43
Vosk और Kaldi लाइब्रेरी पर आधारित WebSocket, gRPC और WebRTC स्पीच रिकग्निशन सर्वर
★ 1,262+1पिछले 7 दिनों में स्टार का बदलाव - #44
टाइमस्टैम्प डेटा के बिना, टाइमस्टैम्प डेटा के साथ, और स्पीच डेटा के बिना ट्रेनिंग का समर्थन करने के लिए Whisper स्पीच रिकग्निशन मॉडल को फाइन-ट्यून करें। इन्फेरेंस को तेज करें और Web डिप्लॉयमेंट, Windows डेस्कटॉप डिप्लॉयमेंट, और Android डिप्लॉयमेंट का समर्थन करें।
★ 1,222-1पिछले 7 दिनों में स्टार का बदलाव - #45
Apple Silicon के लिए AI स्पीच टूलकिट — MLX और CoreML द्वारा संचालित ASR, TTS, स्पीच-टू-स्पीच, VAD और डायराइजेशन
★ 1,161+4पिछले 7 दिनों में स्टार का बदलाव - #46
वास्तविक दुनिया के लिए बनाया गया पहला फाउंडेशन ASR - 7 एटॉमिक अकोस्टिक स्थितियाँ, 54 कंपाउंड परिदृश्य, 2.6M सैंपल, और SOTA की तुलना में ~30% तक का सुधार जहाँ अन्य सभी मॉडल विफल हो जाते हैं। **बाकी सब के विफल होने के बाद, आप MEGA-ASR पर ही वापस आएंगे। ⭐**
★ 1,136+3पिछले 7 दिनों में स्टार का बदलाव - #47
"Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) का [अनौपचारिक] PyTorch कार्यान्वयन
★ 1,132+1पिछले 7 दिनों में स्टार का बदलाव - #48
SGLang-Omni, TTS, ASR, स्पीच और ओम्नी मॉडल के लिए उच्च-प्रदर्शन सर्विंग को सक्षम बनाता है।
★ 1,118+143पिछले 7 दिनों में स्टार का बदलाव - #49
Vosk लाइब्रेरी के साथ Android के लिए ऑफलाइन स्पीच रिकग्निशन
★ 1,057+0पिछले 7 दिनों में स्टार का बदलाव - #50★ 1,057+8पिछले 7 दिनों में स्टार का बदलाव
- #51
LLM पोस्ट-प्रोसेसिंग के साथ पूरी तरह से स्थानीय, निजी और क्रॉस-प्लेटफ़ॉर्म स्पीच-टू-टेक्स्ट
★ 1,056+17पिछले 7 दिनों में स्टार का बदलाव - #52★ 1,040+1पिछले 7 दिनों में स्टार का बदलाव
- #53
ऑल-इन-वन मल्टीमॉडल पार्सिंग इंजन + ऑन्कोलॉजी-संचालित, LLM विकी-संचालित AI-तैयार नॉलेज इंजन।
★ 1,022+178पिछले 7 दिनों में स्टार का बदलाव - #54★ 985+4पिछले 7 दिनों में स्टार का बदलाव
- #55★ 939+0पिछले 7 दिनों में स्टार का बदलाव
- #56
VocoType स्थानीय स्तर पर चलने वाला एक गोपनीयता-सुरक्षित वॉयस इनपुट टूल है, जो हॉटकी के माध्यम से आवाज को वास्तविक समय में टेक्स्ट में बदलता है और इसे वर्तमान एप्लिकेशन में स्वचालित रूप से इनपुट करता है। यह वॉयस-टू-टेक्स्ट MCP, AI टेक्स्ट ऑप्टिमाइज़ेशन, कस्टम रिप्लेसमेंट डिक्शनरी और रिकॉर्डिंग/वीडियो-टू-टेक्स्ट जैसे कार्यों का समर्थन करता है, जिससे वॉयस इनपुट अधिक कुशल और सुरक्षित हो जाता है।
★ 930+10पिछले 7 दिनों में स्टार का बदलाव - #57
यह प्रोजेक्ट एक फाइन-ट्यून्ड और प्रोसेस्ड Whisper ASR मॉडल का उपयोग करके स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए यूजर-लेवल एक्सेस सपोर्ट के साथ एक API प्रदान करता है।
★ 914+0पिछले 7 दिनों में स्टार का बदलाव - #58
Java के लिए मुफ्त ऑफलाइन AI एल्गोरिदम टूलबॉक्स, जो फेस रिकग्निशन, लाइवनेस डिटेक्शन, ऑब्जेक्ट डिटेक्शन, OCR, ASR+TTS और मशीन ट्रांसलेशन जैसे फीचर्स का समर्थन करता है। Maven के माध्यम से उपयोग करने योग्य, PyTorch और Tensorflow के साथ संगत, जिसमें Mtcnn, InsightFace, YOLOv8~v12, PaddleOCR और Whisper जैसे मॉडल शामिल हैं।
★ 910+4पिछले 7 दिनों में स्टार का बदलाव - #59
वॉयस रिकग्निशन, ट्रांसक्रिप्शन और कन्वर्जन आदि के लिए एक उपयोगकर्ता के अनुकूल टूलकिट।
★ 873+0पिछले 7 दिनों में स्टार का बदलाव - #60
PaddlePaddle पर आधारित एंड-टू-एंड चीनी वॉयस रिकग्निशन, शुरुआती से लेकर व्यावहारिक प्रोजेक्ट्स तक। DeepSpeech2, Conformer और Squeezeformer मॉडल्स का समर्थन करता है।
★ 870-1पिछले 7 दिनों में स्टार का बदलाव