मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · speech-recognition

speech-recognition

speech-recognition टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

156 रिपॉजिटरी
  • whisper-jax@sanchit-gandhi

    TPU पर 70x तक की गति बढ़ाने के लिए OpenAI के Whisper मॉडल का JAX कार्यान्वयन।

    4,679-1पिछले 7 दिनों में स्टार का बदलाव
  • pocketsphinx@cmusphinx

    एक छोटा वाक् पहचानकर्ता

    4,337+2पिछले 7 दिनों में स्टार का बदलाव
  • distil-whisper@huggingface

    स्पीच रिकग्निशन के लिए Whisper का डिस्टिल्ड वेरिएंट। 6 गुना तेज़, 50% छोटा, 1% शब्द त्रुटि दर के भीतर।

    4,114+2पिछले 7 दिनों में स्टार का बदलाव
  • OpenAI Whisper ASR वेबसर्विस API

    3,328+2पिछले 7 दिनों में स्टार का बदलाव
  • Whisper और Faster-Whisper के स्टैंडअलोन निष्पादन योग्य (executables) उन लोगों के लिए जो Python के झंझट में नहीं पड़ना चाहते।

    3,171+2पिछले 7 दिनों में स्टार का बदलाव
  • willow@HeyWillow

    ओपन सोर्स, स्थानीय और सेल्फ-होस्टेड Amazon Echo/Google Home का प्रतिस्पर्धी वॉयस असिस्टेंट विकल्प

    3,101+1पिछले 7 दिनों में स्टार का बदलाव
  • whishper@pluja

    वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!

    3,068+2पिछले 7 दिनों में स्टार का बदलाव
  • lingvo@tensorflow

    Lingvo

    2,864+0पिछले 7 दिनों में स्टार का बदलाव
  • whisper-timestamped@linto-ai

    शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)

    2,842+1पिछले 7 दिनों में स्टार का बदलाव
  • STT@coqui-ai

    🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।

    2,606+1पिछले 7 दिनों में स्टार का बदलाव
  • qwen-audio-agent@QwenAudio

    एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम

    2,362+68पिछले 7 दिनों में स्टार का बदलाव
  • tensorflow डीप लर्निंग फ्रेमवर्क, सीक्वेंस-टू-सीक्वेंस न्यूरल नेटवर्क का उपयोग करके 🎙 स्पीच रिकग्निशन

    2,173+0पिछले 7 दिनों में स्टार का बदलाव
  • parlor@fikrikarim

    GPT-Live के समान सुविधाओं के साथ ऑन-डिवाइस, रीयल-टाइम मल्टीмоdal AI

    2,048+7पिछले 7 दिनों में स्टार का बदलाव
  • FireRedASR@FireRedTeam

    मंदारिन, चीनी बोलियों और अंग्रेजी का समर्थन करने वाले ओपन-सोर्स इंडस्ट्रियल-ग्रेड ASR मॉडल, सार्वजनिक मंदारिन ASR बेंचमार्क पर एक नया SOTA हासिल करते हैं, साथ ही उत्कृष्ट गायन गीत पहचान क्षमता भी प्रदान करते हैं।

    1,975+2पिछले 7 दिनों में स्टार का बदलाव
  • masr@nobody132

    चीनी वॉयस रिकॉग्निशन; Mandarin Automatic Speech Recognition;

    1,968+0पिछले 7 दिनों में स्टार का बदलाव
  • julius@julius-speech

    ओपन-सोर्स लार्ज वोकैबुलरी कंटीन्यूअस स्पीच रिकग्निशन इंजन

    1,935+1पिछले 7 दिनों में स्टार का बदलाव
  • अद्भुत स्पीकर डायरिज़ेशन पेपर, लाइब्रेरी, डेटासेट और अन्य संसाधनों की एक क्यूरेटेड सूची।

    1,894+1पिछले 7 दिनों में स्टार का बदलाव
  • alan-sdk-ios@alan-ai

    आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — iOS के लिए Alan AI SDK

    1,878-3पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Android के लिए Alan AI SDK

    1,807-1पिछले 7 दिनों में स्टार का बदलाव
  • whisper-turbo@FL33TW00D

    क्रॉस-प्लेटफ़ॉर्म, GPU त्वरित Whisper 🏎️

    1,794+0पिछले 7 दिनों में स्टार का बदलाव
  • sherpa-ncnn@k2-fsa

    इंटरनेट कनेक्शन के बिना ncnn के साथ अगली पीढ़ी के Kaldi का उपयोग करके वास्तविक समय वाक् पहचान और वॉयस गतिविधि का पता लगाना (VAD)। iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A आदि का समर्थन करता है।

    1,777-1पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Flutter के लिए Alan AI SDK

    1,756-1पिछले 7 दिनों में स्टार का बदलाव
  • alan-sdk-ionic@alan-ai

    आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Ionic के लिए Alan AI SDK

    1,649-1पिछले 7 दिनों में स्टार का बदलाव
  • dsnote@mkiol

    Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।

    1,622+8पिछले 7 दिनों में स्टार का बदलाव
  • AI का उपयोग करके स्थानीय भाषण पहचान और कैप्शनिंग के लिए OBS प्लगइन

    1,597+8पिछले 7 दिनों में स्टार का बदलाव
  • amica@semperai

    Amica वॉयस सिंथेसिस और स्पीच रिकग्निशन के साथ 3D कैरेक्टर के साथ इंटरैक्टिव संचार के लिए एक ओपन सोर्स इंटरफ़ेस है।

    1,591-2पिछले 7 दिनों में स्टार का बदलाव
  • कस्टम नोड्स जो Comfyui की क्षमताओं का विस्तार करते हैं।

    1,525+1पिछले 7 दिनों में स्टार का बदलाव
  • SALMONN@bytedance

    SALMONN परिवार: उन्नत मल्टी-मोडल LLMs का एक सूट

    1,521+3पिछले 7 दिनों में स्टार का बदलाव
  • Fun-ASR@QwenAudio

    चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।

    1,512+10पिछले 7 दिनों में स्टार का बदलाव
  • SpeechT5@microsoft

    Spoken Language Processing के लिए Unified-Modal Speech-Text Pre-Training।

    1,449+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस