मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · asr

asr

asr टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
87
कुल स्टार
2,61,812
औसत स्टार
3,009
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर asr के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और asr टैग वाली रिपॉजिटरी।

  • audio.cpp@0xShug0

    ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।

    2,214
  • jonex@yuezhiai

    ऑल-इन-वन मल्टीमॉडल पार्सिंग इंजन + ऑन्कोलॉजी-संचालित, LLM विकी-संचालित AI-तैयार नॉलेज इंजन।

    1,014
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX: वर्ड-लेवल टाइमस्टैम्प (& डायराइजेशन) के साथ Automatic Speech Recognition

    23,864+61पिछले 7 दिनों में स्टार का बदलाव
  • FunASR@modelscope

    ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।

    20,136+64पिछले 7 दिनों में स्टार का बदलाव
  • Speech@NVIDIA-NeMo

    Linguistic Models, Multimodal और Speech AI पर काम कर रहे शोधकर्ताओं और डेवलपर्स के लिए बनाया गया एक स्केलेबल जनरेटिव AI फ़्रेमवर्क

    18,379+21पिछले 7 दिनों में स्टार का बदलाव
  • vosk-api@alphacep

    Python, Java, C# और Node के साथ Android, iOS, Raspberry Pi और सर्वर के लिए ऑफ़लाइन स्पीच रिकग्निशन API

    15,101+17पिछले 7 दिनों में स्टार का बदलाव
  • sherpa-onnx@k2-fsa

    बिना इंटरनेट कनेक्शन के onnxruntime के साथ नेक्स्ट-जेन Kaldi का उपयोग करके स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच, स्पीकर डायराइजेशन, स्पीच एन्हांसमेंट, सोर्स सेपरेशन और VAD। एम्बेडेड सिस्टम, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 सर्वर, वेबसॉकेट सर्वर/क्लाइंट और 12 प्रोग्रामिंग भाषाओं का समर्थन करता है।

    14,575+95पिछले 7 दिनों में स्टार का बदलाव
  • PaddleSpeech@PaddlePaddle

    उपयोग में आसान स्पीच टूलकिट जिसमें सेल्फ-सुपरवाइज्ड लर्निंग मॉडल, विराम चिह्नों के साथ SOTA/स्ट्रीमिंग ASR, टेक्स्ट फ्रंटएंड के साथ स्ट्रीमिंग TTS, स्पीकर वेरिफिकेशन सिस्टम, एंड-टू-एंड स्पीच ट्रांसलेशन और कीवर्ड स्पॉटिंग शामिल है। NAACL2022 बेस्ट डेमो अवार्ड जीता।

    12,676+5पिछले 7 दिनों में स्टार का बदलाव
  • speechbrain@speechbrain

    PyTorch पर आधारित एक स्पीच टूलकिट।

    11,802+10पिछले 7 दिनों में स्टार का बदलाव
  • SenseVoice@QwenAudio

    मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।

    9,209+37पिछले 7 दिनों में स्टार का बदलाव
  • यह एक Python API है जो आपको किसी दिए गए YouTube वीडियो के लिए ट्रांसक्रिप्ट/सबटाइटल प्राप्त करने की अनुमति देता है। यह स्वचालित रूप से जनरेट किए गए सबटाइटल के लिए भी काम करता है और इसके लिए किसी API की या अन्य सेलेनियम-आधारित समाधानों की तरह हेडलेस ब्राउज़र की आवश्यकता नहीं होती है!

    8,143+14पिछले 7 दिनों में स्टार का बदलाव
  • wukong-robot@wzpan

    🤖 wukong-robot एक सरल, लचीला और सुरुचिपूर्ण चीनी वॉयस डायलॉग रोबोट/स्मार्ट स्पीकर प्रोजेक्ट है, जो ChatGPT मल्टी-राउंड डायलॉग क्षमता का समर्थन करता है, और संभवतः ब्रेन-कंप्यूटर इंटरैक्शन का समर्थन करने वाला पहला ओपन-सोर्स स्मार्ट स्पीकर प्रोजेक्ट है।

    7,126+2पिछले 7 दिनों में स्टार का बदलाव
  • FunClip@modelscope

    लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।

    6,210+13पिछले 7 दिनों में स्टार का बदलाव
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisper के आधार पर स्पीकर डायरीज़ेशन के साथ स्वचालित वाक् पहचान

    5,634+1पिछले 7 दिनों में स्टार का बदलाव
  • Recorder@xiangyuecn

    HTML5 JS रिकॉर्डिंग mp3, wav, ogg, webm, amr, g711a, g711u फॉर्मेट, PC, Android, iOS वेब ब्राउज़र, हाइब्रिड ऐप (Android/iOS ऐप सोर्स कोड के साथ), और WeChat का समर्थन करता है। इसमें ASR वॉयस-टू-टेक्स्ट, H5 वॉयस कॉल चैट उदाहरण और DTMF एन्कोडिंग/डिकोडिंग शामिल है।

    5,631+3पिछले 7 दिनों में स्टार का बदलाव
  • wenet@wenet-e2e

    प्रोडक्शन फर्स्ट और प्रोडक्शन रेडी एंड-टू-एंड स्पीच रिकग्निशन टूलकिट

    5,229+1पिछले 7 दिनों में स्टार का बदलाव
  • LLPlayer@umlx5h

    भाषा सीखने के लिए मीडिया प्लेयर, जिसमें दोहरे उपशीर्षक, AI-जनरेटेड उपशीर्षक, रीयल-टाइम अनुवाद और बहुत कुछ है!

    4,070+12पिछले 7 दिनों में स्टार का बदलाव
  • Streamer-Sales@PeterH0323

    Streamer-Sales - सेल्स-चैंपियन लाइव-स्ट्रीमर LLM बड़ा मॉडल🛒🎁, जो दी गई उत्पाद विशेषताओं के आधार पर उपयोगकर्ताओं की खरीदारी की इच्छा को जगाने के लिए उत्पाद का विवरण देता है।🚀⭐ विस्तृत डेटा जनरेशन प्रक्रिया शामिल है❗ 📦 इसके अलावा इसमें त्वरित अनुमान के लिए LMDeploy 🚀, RAG खोज-संवर्धित जनरेशन 📚, TTS टेक्स्ट-टू-स्पीच 🔊, डिजिटल मानव जनरेशन 🦸, वास्तविक समय की जानकारी खोजने के लिए Agent 🌐, ASR स्पीच-टू-टेक्स्ट 🎙️, फ्रंटएंड के लिए Vue इकोसिस्टम 🍍, बैकएंड के लिए FastAPI 🗝️, और पैकेजिंग एवं परिनियोजन के लिए Docker-compose 🐋 एकीकृत हैं।

    3,764+1पिछले 7 दिनों में स्टार का बदलाव
  • openless@Open-Less

    एक कुंजी दबाकर रखें, बोलें, छोड़ें — किसी भी ऐप में आपके कर्सर पर AI-पॉलिश किया हुआ टेक्स्ट दिखाई देता है। macOS और Windows के लिए ओपन-सोर्स वॉयस इनपुट।

    3,403+44पिछले 7 दिनों में स्टार का बदलाव
  • OpenAI Whisper ASR वेबसर्विस API

    3,328+2पिछले 7 दिनों में स्टार का बदलाव
  • Whisper और Faster-Whisper के स्टैंडअलोन निष्पादन योग्य (executables) उन लोगों के लिए जो Python के झंझट में नहीं पड़ना चाहते।

    3,171+2पिछले 7 दिनों में स्टार का बदलाव
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) एक छोटे मॉडल के साथ ASR, TTS और वॉयस कन्वर्जन कर सकता है!

    3,061+164पिछले 7 दिनों में स्टार का बदलाव
  • faster-whisper-GUI@CheshireCC

    faster_whisper GUI with PySide6

    2,995+4पिछले 7 दिनों में स्टार का बदलाव
  • lingvo@tensorflow

    Lingvo

    2,864+0पिछले 7 दिनों में स्टार का बदलाव
  • whisper-timestamped@linto-ai

    शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)

    2,842+1पिछले 7 दिनों में स्टार का बदलाव
  • FluidAudio@FluidInference

    आपके ऐप्स में फ्रंटियर CoreML ऑडियो मॉडल — टेक्स्ट-टू-स्पीच, स्पीच-टू-टेक्स्ट, वॉयस एक्टिविटी डिटेक्शन, और स्पीकर डायरिज़ेशन। Swift में, SOTA ओपन सोर्स द्वारा संचालित।

    2,723+13पिछले 7 दिनों में स्टार का बदलाव
  • STT@coqui-ai

    🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।

    2,606+1पिछले 7 दिनों में स्टार का बदलाव
  • AudioNotes@harry0703

    ऑडियो और वीडियो सामग्री को तेज़ी से निकालें और इसे एक संरचित markdown नोट्स में व्यवस्थित करें

    2,483+7पिछले 7 दिनों में स्टार का बदलाव
  • audio.cpp@0xShug0

    ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।

    2,214+115पिछले 7 दिनों में स्टार का बदलाव
  • FireRedASR@FireRedTeam

    मंदारिन, चीनी बोलियों और अंग्रेजी का समर्थन करने वाले ओपन-सोर्स इंडस्ट्रियल-ग्रेड ASR मॉडल, सार्वजनिक मंदारिन ASR बेंचमार्क पर एक नया SOTA हासिल करते हैं, साथ ही उत्कृष्ट गायन गीत पहचान क्षमता भी प्रदान करते हैं।

    1,975+2पिछले 7 दिनों में स्टार का बदलाव
  • transcribe.cpp@handy-computer

    16+ मॉडल परिवारों के लिए ggml स्पीच-टू-टेक्स्ट अनुमान

    1,872+19पिछले 7 दिनों में स्टार का बदलाव
  • T2/T3/T5AI/ESP32 और अन्य के लिए अगली पीढ़ी का AI+IoT फ्रेमवर्क – तेज़ IoT और AI Agent हार्डवेयर इंटीग्रेशन

    1,816+5पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस