मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · speech-to-text

speech-to-text

speech-to-text टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
152
कुल स्टार
6,40,857
औसत स्टार
4,216
हिस्सा
0.03%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर speech-to-text के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और speech-to-text टैग वाली रिपॉजिटरी।

  • audio.cpp@0xShug0

    ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।

    2,214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    1,018
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    544
  • Talkify@tornikegomareli

    macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ

    542
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    502
  • whisper.cpp@ggml-org

    C/C++ में OpenAI के Whisper मॉडल का पोर्ट

    53,389+103पिछले 7 दिनों में स्टार का बदलाव
  • Handy@cjpais

    एक मुफ़्त, ओपन-सोर्स और एक्स्टेंसिबल स्पीच-टू-टेक्स्ट एप्लिकेशन जो पूरी तरह से ऑफ़लाइन काम करता है।

    30,916+280पिछले 7 दिनों में स्टार का बदलाव
  • meetily@Zackriya-Solutions

    गोपनीयता-प्रथम, AI मीटिंग सहायक जिसमें 4x तेज़ Parakeet/Whisper लाइव ट्रांसक्रिप्शन, स्पीकर डायरियाज़ेशन, और Rust पर निर्मित Ollama सारांश शामिल है। 100% स्थानीय प्रोसेसिंग, किसी क्लाउड की आवश्यकता नहीं। Meetily (Meetly Ai - https://meetily.ai) macOS और Windows के लिए #1 सेल्फ-होस्टेड, ओपन-सोर्स AI मीटिंग नोट टेकर है। समझें कि मीटिंग के मिनट्स कैसे लिखें

    30,252+195पिछले 7 दिनों में स्टार का बदलाव
  • llamafile@mozilla-ai

    एक ही फ़ाइल के साथ LLMs वितरित करें और चलाएं।

    25,859+113पिछले 7 दिनों में स्टार का बदलाव
  • faster-whisper@SYSTRAN

    CTranslate2 के साथ तेज़ Whisper ट्रांसक्रिप्शन

    25,206+71पिछले 7 दिनों में स्टार का बदलाव
  • whisperX@m-bain

    WhisperX: वर्ड-लेवल टाइमस्टैम्प (& डायराइजेशन) के साथ Automatic Speech Recognition

    23,864+61पिछले 7 दिनों में स्टार का बदलाव
  • screenpipe@screenpipe

    YC (S26) | ओपन कंप्यूटर हिस्ट्री | अपनी स्क्रीन को स्थानीय रूप से लगातार रिकॉर्ड करें और अपने एजेंटों को संदर्भ प्रदान करें (Claude, Codex, Openclaw, Hermes, Runner...)

    21,376+80पिछले 7 दिनों में स्टार का बदलाव
  • FunASR@modelscope

    ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।

    20,136+64पिछले 7 दिनों में स्टार का बदलाव
  • pyvideotrans@jianchang512

    वीडियो को एक भाषा से दूसरी भाषा में अनुवादित करें और डबिंग व उपशीर्षक (subtitles) एम्बेड करें।

    18,871+38पिछले 7 दिनों में स्टार का बदलाव
  • leon@leon-ai

    🧠 Leon आपका ओपन-सोर्स पर्सनल असिस्टेंट है।

    17,476+1पिछले 7 दिनों में स्टार का बदलाव
  • kaldi@kaldi-asr

    kaldi-asr/kaldi, Kaldi प्रोजेक्ट का आधिकारिक स्थान है।

    15,474+3पिछले 7 दिनों में स्टार का बदलाव
  • vosk-api@alphacep

    Python, Java, C# और Node के साथ Android, iOS, Raspberry Pi और सर्वर के लिए ऑफ़लाइन स्पीच रिकग्निशन API

    15,101+17पिछले 7 दिनों में स्टार का बदलाव
  • VoiceStudio@debpalash

    VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।

    14,835+2,880पिछले 7 दिनों में स्टार का बदलाव
  • sherpa-onnx@k2-fsa

    बिना इंटरनेट कनेक्शन के onnxruntime के साथ नेक्स्ट-जेन Kaldi का उपयोग करके स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच, स्पीकर डायराइजेशन, स्पीच एन्हांसमेंट, सोर्स सेपरेशन और VAD। एम्बेडेड सिस्टम, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 सर्वर, वेबसॉकेट सर्वर/क्लाइंट और 12 प्रोग्रामिंग भाषाओं का समर्थन करता है।

    14,575+95पिछले 7 दिनों में स्टार का बदलाव
  • speech-to-speech@huggingface

    ओपन-सोर्स मॉडल के साथ वॉयस एजेंट बनाएं

    13,015+82पिछले 7 दिनों में स्टार का बदलाव
  • voice-pro@abus-aikorea

    क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।

    12,730+54पिछले 7 दिनों में स्टार का बदलाव
  • speechbrain@speechbrain

    PyTorch पर आधारित एक स्पीच टूलकिट।

    11,802+10पिछले 7 दिनों में स्टार का बदलाव
  • WhisperLiveKit@QuentinFuxa

    स्ट्रीमिंग ASR, स्पीकर डायरिज़ेशन, अनुवाद और OpenAI/Deepgram-संगत API के साथ रीयल-टाइम, स्थानीय स्पीच-टू-टेक्स्ट।

    10,990+16पिछले 7 दिनों में स्टार का बदलाव
  • RealtimeSTT@KoljaB

    उन्नत वॉयस एक्टिविटी डिटेक्शन, वेक वर्ड एक्टिवेशन और त्वरित ट्रांसक्रिप्शन के साथ एक मजबूत, कुशल, कम-विलंबता स्पीच-टू-टेक्स्ट लाइब्रेरी।

    10,108+18पिछले 7 दिनों में स्टार का बदलाव
  • SenseVoice@QwenAudio

    मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।

    9,209+37पिछले 7 दिनों में स्टार का बदलाव
  • Python के लिए स्पीच रिकग्निशन मॉड्यूल, जो कई इंजन और API, ऑनलाइन और ऑफलाइन का समर्थन करता है

    8,987+0पिछले 7 दिनों में स्टार का बदलाव
  • एक गहरे-अधिगम-आधारित चीनी वाक् पहचान प्रणाली

    8,386+0पिछले 7 दिनों में स्टार का बदलाव
  • mlx-audio@Blaizzy

    Apple के MLX फ्रेमवर्क पर बनी एक टेक्स्ट-टू-स्पीच (TTS), स्पीच-टू-टेक्स्ट (STT) और स्पीच-टू-स्पीच (STS) लाइब्रेरी, जो Apple Silicon पर कुशल भाषण विश्लेषण प्रदान करती है।

    7,826+23पिछले 7 दिनों में स्टार का बदलाव
  • annyang@TalAter

    💬 आपकी साइट के लिए स्पीच रिकग्निशन

    6,815-1पिछले 7 दिनों में स्टार का बदलाव
  • argmax-oss-swift@argmaxinc

    Apple Silicon के लिए ऑन-डिवाइस स्पीच AI

    6,353+8पिछले 7 दिनों में स्टार का बदलाव
  • FunClip@modelscope

    लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।

    6,210+13पिछले 7 दिनों में स्टार का बदलाव
  • openwhispr@OpenWhispr

    स्थानीय (Nvidia Parakeet/Whisper) और क्लाउड मॉडल (BYOK) के साथ वॉयस-टू-टेक्स्ट डिक्टेशन ऐप। गोपनीयता-प्रथम और क्रॉस-प्लेटफ़ॉर्म उपलब्ध।

    6,133+305पिछले 7 दिनों में स्टार का बदलाव
  • silero-models@snakers4

    Silero मॉडल: प्री-ट्रेनिंग टेक्स्ट-टू-स्पीच मॉडल जिन्हें अत्यंत सरल बनाया गया है

    6,084-1पिछले 7 दिनों में स्टार का बदलाव
  • ODS@Osmantic

    अपने PC, Mac, या Linux बॉक्स को AI सर्वर में बदलें। LLM इन्फेंस, चैट UI, वॉयस, एजेंट, वर्कफ़्लो, RAG, और इमेज जनरेशन।

    5,931+1,108पिछले 7 दिनों में स्टार का बदलाव
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisper के आधार पर स्पीकर डायरीज़ेशन के साथ स्वचालित वाक् पहचान

    5,634+1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस