speech-to-text
speech-to-text टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर speech-to-text के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और speech-to-text टैग वाली रिपॉजिटरी।
- #1
ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।
★ 2,214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1,018 - #3
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 544 - #4
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 542 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 502
- #1
C/C++ में OpenAI के Whisper मॉडल का पोर्ट
★ 53,389+103पिछले 7 दिनों में स्टार का बदलाव - #2
एक मुफ़्त, ओपन-सोर्स और एक्स्टेंसिबल स्पीच-टू-टेक्स्ट एप्लिकेशन जो पूरी तरह से ऑफ़लाइन काम करता है।
★ 30,916+280पिछले 7 दिनों में स्टार का बदलाव - #3
गोपनीयता-प्रथम, AI मीटिंग सहायक जिसमें 4x तेज़ Parakeet/Whisper लाइव ट्रांसक्रिप्शन, स्पीकर डायरियाज़ेशन, और Rust पर निर्मित Ollama सारांश शामिल है। 100% स्थानीय प्रोसेसिंग, किसी क्लाउड की आवश्यकता नहीं। Meetily (Meetly Ai - https://meetily.ai) macOS और Windows के लिए #1 सेल्फ-होस्टेड, ओपन-सोर्स AI मीटिंग नोट टेकर है। समझें कि मीटिंग के मिनट्स कैसे लिखें
★ 30,252+195पिछले 7 दिनों में स्टार का बदलाव - #4★ 25,859+113पिछले 7 दिनों में स्टार का बदलाव
- #5
CTranslate2 के साथ तेज़ Whisper ट्रांसक्रिप्शन
★ 25,206+71पिछले 7 दिनों में स्टार का बदलाव - #6★ 23,864+61पिछले 7 दिनों में स्टार का बदलाव
- #7
YC (S26) | ओपन कंप्यूटर हिस्ट्री | अपनी स्क्रीन को स्थानीय रूप से लगातार रिकॉर्ड करें और अपने एजेंटों को संदर्भ प्रदान करें (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21,376+80पिछले 7 दिनों में स्टार का बदलाव - #8
ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।
★ 20,136+64पिछले 7 दिनों में स्टार का बदलाव - #9
वीडियो को एक भाषा से दूसरी भाषा में अनुवादित करें और डबिंग व उपशीर्षक (subtitles) एम्बेड करें।
★ 18,871+38पिछले 7 दिनों में स्टार का बदलाव - #10★ 17,476+1पिछले 7 दिनों में स्टार का बदलाव
- #11★ 15,474+3पिछले 7 दिनों में स्टार का बदलाव
- #12
Python, Java, C# और Node के साथ Android, iOS, Raspberry Pi और सर्वर के लिए ऑफ़लाइन स्पीच रिकग्निशन API
★ 15,101+17पिछले 7 दिनों में स्टार का बदलाव - #13
VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।
★ 14,835+2,880पिछले 7 दिनों में स्टार का बदलाव - #14
बिना इंटरनेट कनेक्शन के onnxruntime के साथ नेक्स्ट-जेन Kaldi का उपयोग करके स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच, स्पीकर डायराइजेशन, स्पीच एन्हांसमेंट, सोर्स सेपरेशन और VAD। एम्बेडेड सिस्टम, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 सर्वर, वेबसॉकेट सर्वर/क्लाइंट और 12 प्रोग्रामिंग भाषाओं का समर्थन करता है।
★ 14,575+95पिछले 7 दिनों में स्टार का बदलाव - #15
ओपन-सोर्स मॉडल के साथ वॉयस एजेंट बनाएं
★ 13,015+82पिछले 7 दिनों में स्टार का बदलाव - #16
क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।
★ 12,730+54पिछले 7 दिनों में स्टार का बदलाव - #17
PyTorch पर आधारित एक स्पीच टूलकिट।
★ 11,802+10पिछले 7 दिनों में स्टार का बदलाव - #18
स्ट्रीमिंग ASR, स्पीकर डायरिज़ेशन, अनुवाद और OpenAI/Deepgram-संगत API के साथ रीयल-टाइम, स्थानीय स्पीच-टू-टेक्स्ट।
★ 10,990+16पिछले 7 दिनों में स्टार का बदलाव - #19
उन्नत वॉयस एक्टिविटी डिटेक्शन, वेक वर्ड एक्टिवेशन और त्वरित ट्रांसक्रिप्शन के साथ एक मजबूत, कुशल, कम-विलंबता स्पीच-टू-टेक्स्ट लाइब्रेरी।
★ 10,108+18पिछले 7 दिनों में स्टार का बदलाव - #20
मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।
★ 9,209+37पिछले 7 दिनों में स्टार का बदलाव - #21
Python के लिए स्पीच रिकग्निशन मॉड्यूल, जो कई इंजन और API, ऑनलाइन और ऑफलाइन का समर्थन करता है
★ 8,987+0पिछले 7 दिनों में स्टार का बदलाव - #22
एक गहरे-अधिगम-आधारित चीनी वाक् पहचान प्रणाली
★ 8,386+0पिछले 7 दिनों में स्टार का बदलाव - #23
Apple के MLX फ्रेमवर्क पर बनी एक टेक्स्ट-टू-स्पीच (TTS), स्पीच-टू-टेक्स्ट (STT) और स्पीच-टू-स्पीच (STS) लाइब्रेरी, जो Apple Silicon पर कुशल भाषण विश्लेषण प्रदान करती है।
★ 7,826+23पिछले 7 दिनों में स्टार का बदलाव - #24★ 6,815-1पिछले 7 दिनों में स्टार का बदलाव
- #25
Apple Silicon के लिए ऑन-डिवाइस स्पीच AI
★ 6,353+8पिछले 7 दिनों में स्टार का बदलाव - #26
लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।
★ 6,210+13पिछले 7 दिनों में स्टार का बदलाव - #27
स्थानीय (Nvidia Parakeet/Whisper) और क्लाउड मॉडल (BYOK) के साथ वॉयस-टू-टेक्स्ट डिक्टेशन ऐप। गोपनीयता-प्रथम और क्रॉस-प्लेटफ़ॉर्म उपलब्ध।
★ 6,133+305पिछले 7 दिनों में स्टार का बदलाव - #28
Silero मॉडल: प्री-ट्रेनिंग टेक्स्ट-टू-स्पीच मॉडल जिन्हें अत्यंत सरल बनाया गया है
★ 6,084-1पिछले 7 दिनों में स्टार का बदलाव - #29
अपने PC, Mac, या Linux बॉक्स को AI सर्वर में बदलें। LLM इन्फेंस, चैट UI, वॉयस, एजेंट, वर्कफ़्लो, RAG, और इमेज जनरेशन।
★ 5,931+1,108पिछले 7 दिनों में स्टार का बदलाव - #30
OpenAI Whisper के आधार पर स्पीकर डायरीज़ेशन के साथ स्वचालित वाक् पहचान
★ 5,634+1पिछले 7 दिनों में स्टार का बदलाव