मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · asr

asr

asr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

88 रिपॉजिटरी
  • sherpa-ncnn@k2-fsa

    इंटरनेट कनेक्शन के बिना ncnn के साथ अगली पीढ़ी के Kaldi का उपयोग करके वास्तविक समय वाक् पहचान और वॉयस गतिविधि का पता लगाना (VAD)। iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A आदि का समर्थन करता है।

    1,777-1पिछले 7 दिनों में स्टार का बदलाव
  • bailing@wwbin2017

    Bailing GPT-4o जैसा एक语音对话机器人 है, जो ASR+LLM+TTS के माध्यम से महसूस किया जाता है, DeepSeek R1 जैसे उत्कृष्ट बड़े मॉडल को एकीकृत करता है, openClaw तक पहुंचता है, एक सच्चा व्यक्तिगत语音 सहायक है, विलंबता 800ms जितनी कम है, Mac जैसे कम-कॉन्फ़िगरेशन वाले डिवाइस भी चल सकते हैं, और रुकावट का समर्थन करता है।

    1,759+2पिछले 7 दिनों में स्टार का बदलाव
  • dsnote@mkiol

    Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।

    1,622+8पिछले 7 दिनों में स्टार का बदलाव
  • video-analyzer@byjlw

    LLMs, कंप्यूटर विज़न और ऑटोमैटिक स्पीच रिकग्निशन का उपयोग करके वीडियो का विश्लेषण करें

    1,570+8पिछले 7 दिनों में स्टार का बदलाव
  • amical@amicalhq

    🎙️ AI डिक्टेशन ऐप - ओपन सोर्स और लोकल-फर्स्ट ⚡ 3x तेजी से टाइप करें, कीबोर्ड की आवश्यकता नहीं। 🆓 ओपन सोर्स मॉडल द्वारा संचालित, ऑफ़लाइन काम करता है, तेज़ और सटीक।

    1,520+8पिछले 7 दिनों में स्टार का बदलाव
  • Fun-ASR@QwenAudio

    चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।

    1,512+10पिछले 7 दिनों में स्टार का बदलाव
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge एक प्रोजेक्ट है जिसे TTS जनरेशन मॉडल के चारों ओर विकसित किया गया है, जो एक API सर्वर और Gradio-आधारित WebUI को लागू करता है।

    1,418+0पिछले 7 दिनों में स्टार का बदलाव
  • SoniTranslate@R3gm

    वीडियो के लिए सिंक्रोनाइज्ड ट्रांसलेशन। वीडियो डबिंग

    1,413+2पिछले 7 दिनों में स्टार का बदलाव
  • CrisperWhisper@nyrahealth

    नियंत्रित ट्रांसक्रिप्शन। शब्द-स्तर के टाइमस्टैम्प के साथ सटीक (प्रत्येक फिलर, विराम, हकलाना, स्वर ध्वनि) या इच्छित (वक्ता क्या कहना चाहता था, पठनीयता के लिए अनुकूलित)।

    1,371+13पिछले 7 दिनों में स्टार का बदलाव
  • voicemode@mbailey

    Claude Code के साथ प्राकृतिक आवाज़ की बातचीत

    1,347+6पिछले 7 दिनों में स्टार का बदलाव
  • VideoChat@Henry-23

    रीयल-टाइम वॉयस इंटरैक्टिव डिजिटल ह्यूमन, कस्टमाइज़ करने योग्य रूप और आवाज़, वॉयस क्लोनिंग का समर्थन करता है, जिसमें प्रारंभिक पैकेज विलंबता 3s जितनी कम है।

    1,303-1पिछले 7 दिनों में स्टार का बदलाव
  • StreamSpeech@ictnlp

    StreamSpeech ऑफ़लाइन और एक साथ स्पीच रिकग्निशन, स्पीच ट्रांसलेशन और स्पीच सिंथेसिस के लिए एक "ऑल इन वन" सीमलेस मॉडल है।

    1,288+0पिछले 7 दिनों में स्टार का बदलाव
  • vosk-server@alphacep

    Vosk और Kaldi लाइब्रेरी पर आधारित WebSocket, gRPC और WebRTC स्पीच रिकग्निशन सर्वर

    1,262+1पिछले 7 दिनों में स्टार का बदलाव
  • Whisper-Finetune@yeyupiaoling

    टाइमस्टैम्प डेटा के बिना, टाइमस्टैम्प डेटा के साथ, और स्पीच डेटा के बिना ट्रेनिंग का समर्थन करने के लिए Whisper स्पीच रिकग्निशन मॉडल को फाइन-ट्यून करें। इन्फेरेंस को तेज करें और Web डिप्लॉयमेंट, Windows डेस्कटॉप डिप्लॉयमेंट, और Android डिप्लॉयमेंट का समर्थन करें।

    1,222-1पिछले 7 दिनों में स्टार का बदलाव
  • speech-swift@soniqo

    Apple Silicon के लिए AI स्पीच टूलकिट — MLX और CoreML द्वारा संचालित ASR, TTS, स्पीच-टू-स्पीच, VAD और डायराइजेशन

    1,161+4पिछले 7 दिनों में स्टार का बदलाव
  • Mega-ASR@xzf-thu

    वास्तविक दुनिया के लिए बनाया गया पहला फाउंडेशन ASR - 7 एटॉमिक अकोस्टिक स्थितियाँ, 54 कंपाउंड परिदृश्य, 2.6M सैंपल, और SOTA की तुलना में ~30% तक का सुधार जहाँ अन्य सभी मॉडल विफल हो जाते हैं। **बाकी सब के विफल होने के बाद, आप MEGA-ASR पर ही वापस आएंगे। ⭐**

    1,136+3पिछले 7 दिनों में स्टार का बदलाव
  • conformer@sooftware

    "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) का [अनौपचारिक] PyTorch कार्यान्वयन

    1,132+1पिछले 7 दिनों में स्टार का बदलाव
  • sglang-omni@sgl-project

    SGLang-Omni, TTS, ASR, स्पीच और ओम्नी मॉडल के लिए उच्च-प्रदर्शन सर्विंग को सक्षम बनाता है।

    1,118+143पिछले 7 दिनों में स्टार का बदलाव
  • Vosk लाइब्रेरी के साथ Android के लिए ऑफलाइन स्पीच रिकग्निशन

    1,057+0पिछले 7 दिनों में स्टार का बदलाव
  • violin@shang-zhu

    ओपन-सोर्स वीडियो अनुवाद कौशल

    1,057+8पिछले 7 दिनों में स्टार का बदलाव
  • murmure@Kieirra

    LLM पोस्ट-प्रोसेसिंग के साथ पूरी तरह से स्थानीय, निजी और क्रॉस-प्लेटफ़ॉर्म स्पीच-टू-टेक्स्ट

    1,056+17पिछले 7 दिनों में स्टार का बदलाव
  • pykaldi@pykaldi

    Kaldi के लिए एक Python रैपर।

    1,040+1पिछले 7 दिनों में स्टार का बदलाव
  • jonex@yuezhiai

    ऑल-इन-वन मल्टीमॉडल पार्सिंग इंजन + ऑन्कोलॉजी-संचालित, LLM विकी-संचालित AI-तैयार नॉलेज इंजन।

    1,022+178पिछले 7 दिनों में स्टार का बदलाव
  • sherpa@k2-fsa

    नेक्स्ट-जेन Kaldi के साथ स्पीच-टू-टेक्स्ट सर्वर फ्रेमवर्क

    985+4पिछले 7 दिनों में स्टार का बदलाव
  • espresso@freewym

    Espresso: एक तेज़ एंड-टू-एंड न्यूरल स्पीच रिकग्निशन टूलकिट

    939+0पिछले 7 दिनों में स्टार का बदलाव
  • vocotype-cli@233stone

    VocoType स्थानीय स्तर पर चलने वाला एक गोपनीयता-सुरक्षित वॉयस इनपुट टूल है, जो हॉटकी के माध्यम से आवाज को वास्तविक समय में टेक्स्ट में बदलता है और इसे वर्तमान एप्लिकेशन में स्वचालित रूप से इनपुट करता है। यह वॉयस-टू-टेक्स्ट MCP, AI टेक्स्ट ऑप्टिमाइज़ेशन, कस्टम रिप्लेसमेंट डिक्शनरी और रिकॉर्डिंग/वीडियो-टू-टेक्स्ट जैसे कार्यों का समर्थन करता है, जिससे वॉयस इनपुट अधिक कुशल और सुरक्षित हो जाता है।

    930+10पिछले 7 दिनों में स्टार का बदलाव
  • whisper.api@innovatorved

    यह प्रोजेक्ट एक फाइन-ट्यून्ड और प्रोसेस्ड Whisper ASR मॉडल का उपयोग करके स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए यूजर-लेवल एक्सेस सपोर्ट के साथ एक API प्रदान करता है।

    914+0पिछले 7 दिनों में स्टार का बदलाव
  • SmartJavaAI@geekwenjie

    Java के लिए मुफ्त ऑफलाइन AI एल्गोरिदम टूलबॉक्स, जो फेस रिकग्निशन, लाइवनेस डिटेक्शन, ऑब्जेक्ट डिटेक्शन, OCR, ASR+TTS और मशीन ट्रांसलेशन जैसे फीचर्स का समर्थन करता है। Maven के माध्यम से उपयोग करने योग्य, PyTorch और Tensorflow के साथ संगत, जिसमें Mtcnn, InsightFace, YOLOv8~v12, PaddleOCR और Whisper जैसे मॉडल शामिल हैं।

    910+4पिछले 7 दिनों में स्टार का बदलाव
  • Easy-Voice-Toolkit@Spr-Aachen

    वॉयस रिकग्निशन, ट्रांसक्रिप्शन और कन्वर्जन आदि के लिए एक उपयोगकर्ता के अनुकूल टूलकिट।

    873+0पिछले 7 दिनों में स्टार का बदलाव
  • PPASR@yeyupiaoling

    PaddlePaddle पर आधारित एंड-टू-एंड चीनी वॉयस रिकग्निशन, शुरुआती से लेकर व्यावहारिक प्रोजेक्ट्स तक। DeepSpeech2, Conformer और Squeezeformer मॉडल्स का समर्थन करता है।

    870-1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस