मुख्य सामग्री पर जाएँ
buildradar
साइन इन करें
विषय · speech-to-text

speech-to-text

speech-to-text टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

152 रिपॉजिटरी
  • dograh@dograh-hq

    ओपन सोर्स वॉयस AI प्लेटफॉर्म। Vapi और Retell का सेल्फ-होस्टेड विकल्प। ऑन-प्रेम, स्पीच-टू-स्पीच या LLM/STT/TTS में BYOK, विजुअल वर्कफ्लो बिल्डर, MCP नेटिव और टेलीफोनी सहायता के साथ।

    5,568+0पिछले 7 दिनों में स्टार का बदलाव
  • YouDub-webui@liuzhao1225

    ओपन-सोर्स AI वीडियो लोकलाइजेशन टूल: YouTube/Bilibili वीडियो डाउनलोड, उपशीर्षक पहचान और अनुवाद, वॉयस क्लोनिंग डबिंग, ऑडियो ट्रैक मिक्सिंग और उपशीर्षक बर्निंग को स्वचालित रूप से पूरा करता है।

    5,404+0पिछले 7 दिनों में स्टार का बदलाव
  • stt@jianchang512

    वॉयस रिकग्निशन टू टेक्स्ट टूल / एक ऑफ़लाइन चलने वाला स्थानीय ऑडियो-वीडियो से सबटाइटल टूल, जो json, srt सबटाइटल और सादे पाठ प्रारूप में आउटपुट देता है

    4,780+0पिछले 7 दिनों में स्टार का बदलाव
  • whisper-jax@sanchit-gandhi

    TPU पर 70x तक की गति बढ़ाने के लिए OpenAI के Whisper मॉडल का JAX कार्यान्वयन।

    4,679+0पिछले 7 दिनों में स्टार का बदलाव
  • fastrtc@gradio-app

    रियल-टाइम कम्युनिकेशन के लिए पाइथन लाइब्रेरी

    4,624+0पिछले 7 दिनों में स्टार का बदलाव
  • auto-subs@tmoroney

    ऑन-डिवाइस उपशीर्षक निर्माण जो सीधे DaVinci Resolve, Premiere और After Effects से जुड़ता है।

    4,122+0पिछले 7 दिनों में स्टार का बदलाव
  • Windows LiveCaptions पर आधारित एक हल्का और शक्तिशाली रीयल-टाइम ऑडियो/स्पीच ट्रांसलेशन टूल।

    3,637+0पिछले 7 दिनों में स्टार का बदलाव
  • openless@Open-Less

    एक कुंजी दबाकर रखें, बोलें, छोड़ें — किसी भी ऐप में आपके कर्सर पर AI-पॉलिश किया हुआ टेक्स्ट दिखाई देता है। macOS और Windows के लिए ओपन-सोर्स वॉयस इनपुट।

    3,403+0पिछले 7 दिनों में स्टार का बदलाव
  • OpenAI Whisper ASR वेबसर्विस API

    3,328+0पिछले 7 दिनों में स्टार का बदलाव
  • Whisper और Faster-Whisper के स्टैंडअलोन निष्पादन योग्य (executables) उन लोगों के लिए जो Python के झंझट में नहीं पड़ना चाहते।

    3,171+0पिछले 7 दिनों में स्टार का बदलाव
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni, Llama-3.1-8B-Instruct पर आधारित एक कम-विलंबता और उच्च-गुणवत्ता वाला एंड-टू-एंड स्पीच इंटरेक्शन मॉडल है, जिसका उद्देश्य GPT-4o स्तर की स्पीच क्षमताएं प्राप्त करना है।

    3,147+0पिछले 7 दिनों में स्टार का बदलाव
  • willow@HeyWillow

    ओपन सोर्स, स्थानीय और सेल्फ-होस्टेड Amazon Echo/Google Home का प्रतिस्पर्धी वॉयस असिस्टेंट विकल्प

    3,101+0पिछले 7 दिनों में स्टार का बदलाव
  • whishper@pluja

    वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!

    3,068+0पिछले 7 दिनों में स्टार का बदलाव
  • lingvo@tensorflow

    Lingvo

    2,864+0पिछले 7 दिनों में स्टार का बदलाव
  • whisper-timestamped@linto-ai

    शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)

    2,842+0पिछले 7 दिनों में स्टार का बदलाव
  • vexa@Vexa-ai

    Google Meet, Microsoft Teams और Zoom के लिए ओपन-सोर्स मीटिंग ट्रांसक्रिप्शन API। ऑटो-जॉइन बॉट्स, रियल-टाइम WebSocket ट्रांसक्रिप्ट, AI एजेंटों के लिए MCP सर्वर। सेल्फ-होस्ट करें या होस्टेड SaaS का उपयोग करें।

    2,741+0पिछले 7 दिनों में स्टार का बदलाव
  • FluidAudio@FluidInference

    आपके ऐप्स में फ्रंटियर CoreML ऑडियो मॉडल — टेक्स्ट-टू-स्पीच, स्पीच-टू-टेक्स्ट, वॉयस एक्टिविटी डिटेक्शन, और स्पीकर डायरिज़ेशन। Swift में, SOTA ओपन सोर्स द्वारा संचालित।

    2,723+0पिछले 7 दिनों में स्टार का बदलाव
  • pluely@iamsrikanthnani

    Cluely का ओपन सोर्स विकल्प - एक बिजली की तरह तेज़, गोपनीयता-प्रथम AI सहायक जो मीटिंग्स, इंटरव्यू और बातचीत के दौरान किसी को पता चले बिना सहजता से काम करता है। नेटिव प्रदर्शन के लिए Tauri के साथ निर्मित, केवल 10MB। वीडियो कॉल, स्क्रीन शेयर और रिकॉर्डिंग में पूरी तरह से अदृश्य।

    2,619+0पिछले 7 दिनों में स्टार का बदलाव
  • STT@coqui-ai

    🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।

    2,606+0पिछले 7 दिनों में स्टार का बदलाव
  • foundry-local@microsoft
    2,537+0पिछले 7 दिनों में स्टार का बदलाव
  • awesome-whisper@sindresorhus

    🔊 Whisper के लिए शानदार सूची — OpenAI द्वारा विकसित एक ओपन-सोर्स AI-संचालित वाक् पहचान प्रणाली

    2,375+0पिछले 7 दिनों में स्टार का बदलाव
  • openscreen@getopenscreen

    अपनी स्क्रीन रिकॉर्ड करें, डेमो शिप करें। निःशुल्क और ओपन-सोर्स, GPU-त्वरित, कोई वॉटरमार्क नहीं, कोई सब्सक्रिप्शन नहीं। Windows, macOS, Linux। सक्रिय रूप से मेंटेन किया गया।

    2,287+0पिछले 7 दिनों में स्टार का बदलाव
  • ququ@yan5xu

    ओपन-सोर्स और मुफ़्त Wispr Flow विकल्प | FunASR स्थानीय मॉडल और कॉन्फ़िगर करने योग्य LLM को एकीकृत करने वाला अगली पीढ़ी का चीनी डेस्कटॉप वॉइस वर्कफ़्लो

    2,278+0पिछले 7 दिनों में स्टार का बदलाव
  • audio.cpp@0xShug0

    ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।

    2,214+0पिछले 7 दिनों में स्टार का बदलाव
  • WhisperJAV@meizhong986

    ASR/STT उपशीर्षक जनरेटर। Qwen3-ASR, स्थानीय LLM, Whisper, TEN-VAD का उपयोग करता है। JAV के लिए शोर-रोधी

    2,196+0पिछले 7 दिनों में स्टार का बदलाव
  • tensorflow डीप लर्निंग फ्रेमवर्क, सीक्वेंस-टू-सीक्वेंस न्यूरल नेटवर्क का उपयोग करके 🎙 स्पीच रिकग्निशन

    2,173+0पिछले 7 दिनों में स्टार का बदलाव
  • soloud@jarikomppa

    गेम के लिए स्वतंत्र, आसान और पोर्टेबल ऑडियो इंजन।

    2,170+0पिछले 7 दिनों में स्टार का बदलाव
  • vad@ricky0123

    एक सरल API के साथ ब्राउज़र के लिए वॉयस एक्टिविटी डिटेक्टर (VAD)।

    2,046+0पिछले 7 दिनों में स्टार का बदलाव
  • audapolis@bugbakery

    स्वचालित ट्रांसक्रिप्शन के साथ बोले गए ऑडियो के लिए एक संपादक

    1,892+0पिछले 7 दिनों में स्टार का बदलाव
  • transcribe.cpp@handy-computer

    16+ मॉडल परिवारों के लिए ggml स्पीच-टू-टेक्स्ट अनुमान

    1,872+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस