stt
stt टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर stt के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और stt टैग वाली रिपॉजिटरी।
- #1
AI वॉयस एजेंटों के लिए स्पेंड मीटर और बजट गेट। आउट-ऑफ-द-बॉक्स STT + TTS + LLM + टेलीफोनी (Pipecat, LiveKit — Python और TypeScript) को ट्रैक करता है। सीमा पार होने से पहले अगले टर्न को हार्ड-स्टॉप करता है। लोकल, कोई अकाउंट नहीं, कोई टेलीमेट्री नहीं। Floe द्वारा निर्मित — Voice AI के लिए लागत नियंत्रण।
★ 434
- #1
आपका AI दूसरा दिमाग। सेल्फ-होस्ट करने योग्य। वेब या अपने दस्तावेज़ों से उत्तर प्राप्त करें। कस्टम एजेंट बनाएं, स्वचालन शेड्यूल करें, गहन शोध करें। किसी भी ऑनलाइन या स्थानीय LLM को अपने पर्सनल, स्वायत्त AI (gpt, claude, gemini, llama, qwen, mistral) में बदलें। शुरुआत करें - मुफ़्त।
★ 37,010+223पिछले 7 दिनों में स्टार का बदलाव - #2
Python, Java, C# और Node के साथ Android, iOS, Raspberry Pi और सर्वर के लिए ऑफ़लाइन स्पीच रिकग्निशन API
★ 15,101+17पिछले 7 दिनों में स्टार का बदलाव - #3
वॉइस एजेंट और इंटरफेस बनाने के लिए बहुत कम विलंबता (low latency) वाला स्पीच-टू-टेक्स्ट, इंटेंट रिकग्निशन और टेक्स्ट-टू-स्पीच
★ 10,997+33पिछले 7 दिनों में स्टार का बदलाव - #4
Stream द्वारा ओपन विजन एजेंट्स। किसी भी मॉडल या वीडियो प्रदाता के साथ तुरंत वॉयस और विजन एजेंट बनाएं।
★ 8,113+9पिछले 7 दिनों में स्टार का बदलाव - #5
वॉयस रिकग्निशन टू टेक्स्ट टूल / एक ऑफ़लाइन चलने वाला स्थानीय ऑडियो-वीडियो से सबटाइटल टूल, जो json, srt सबटाइटल और सादे पाठ प्रारूप में आउटपुट देता है
★ 4,780+9पिछले 7 दिनों में स्टार का बदलाव - #6
वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!
★ 3,068+2पिछले 7 दिनों में स्टार का बदलाव - #7
🐸STT - स्पीच-टू-टेक्स्ट के लिए डीप लर्निंग टूलकिट। STT मॉडल को प्रशिक्षित करना और तैनात करना इतना आसान कभी नहीं रहा।
★ 2,606+1पिछले 7 दिनों में स्टार का बदलाव - #8
tensorflow डीप लर्निंग फ्रेमवर्क, सीक्वेंस-टू-सीक्वेंस न्यूरल नेटवर्क का उपयोग करके 🎙 स्पीच रिकग्निशन
★ 2,173+0पिछले 7 दिनों में स्टार का बदलाव - #9
AI साथियों और उपकरणों के लिए सुरक्षित वेबसोकेट और एज फ़ंक्शंस के साथ Arduino ESP32 पर 100+ मॉडल के साथ रियलटाइम वॉयस AI टॉयज
★ 1,938+5पिछले 7 दिनों में स्टार का बदलाव - #10
Ava से मिलें, WhatsApp एजेंट
★ 1,675+2पिछले 7 दिनों में स्टार का बदलाव - #11
Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।
★ 1,622+8पिछले 7 दिनों में स्टार का बदलाव - #12
Android के लिए Dicio असिस्टेंट ऐप
★ 1,463+3पिछले 7 दिनों में स्टार का बदलाव - #13
🍦 Speech-AI-Forge एक प्रोजेक्ट है जिसे TTS जनरेशन मॉडल के चारों ओर विकसित किया गया है, जो एक API सर्वर और Gradio-आधारित WebUI को लागू करता है।
★ 1,418+0पिछले 7 दिनों में स्टार का बदलाव - #14
वीडियो के लिए सिंक्रोनाइज्ड ट्रांसलेशन। वीडियो डबिंग
★ 1,413+2पिछले 7 दिनों में स्टार का बदलाव - #15
💎 ASR, TTS और अन्य Speech Technologies के लिए एक्सेसिबल स्पीच कॉर्पोरा की एक सूची
★ 1,399+0पिछले 7 दिनों में स्टार का बदलाव - #16
Xiaozhi ESP32 Java एप्राइज मैनेजमेंट प्लेटफॉर्म, जो डिवाइस मॉनिटरिंग, वॉइस कस्टमाइजेशन, रोल स्विचिंग और चैट लॉग मैनेजमेंट के लिए फ्रंटएंड, बैकएंड और सर्वर-साइड इंटीग्रेटेड सॉल्यूशन प्रदान करता है।
★ 1,337+1पिछले 7 दिनों में स्टार का बदलाव - #17
Gp.nvim (GPT prompt) Neovim AI प्लगइन: ChatGPT सत्र और निर्देश योग्य टेक्स्ट/कोड संचालन और स्पीच टू टेक्स्ट [OpenAI, Ollama, Anthropic, ..]
★ 1,320+0पिछले 7 दिनों में स्टार का बदलाव - #18
रीयल-टाइम स्पीच ट्रांसलेशन — macOS और Windows, मुफ़्त TTS, कोई सर्वर नहीं, केवल आपकी API कुंजियाँ
★ 1,278+2पिछले 7 दिनों में स्टार का बदलाव - #19
द्विभाषी बैठकों के लिए रीयल-टाइम टू-वे स्पीच ट्रांसलेशन — यह बोली जाने वाली भाषा का स्वतः पता लगाता है और दोनों दिशाओं में अनुवाद करता है, क्लाउड या पूरी तरह से ऑफलाइन डिवाइस पर काम करता है। ज़ूम, मीट, टीम्स और किसी भी ऐप के लिए डेस्कटॉप (Windows, macOS, Linux) और ब्राउज़र एक्सटेंशन (Chrome, Edge) उपलब्ध है।
★ 1,186+40पिछले 7 दिनों में स्टार का बदलाव - #20
NobodyWho एक इन्फरेंस इंजन है जो आपको किसी भी डिवाइस पर स्थानीय रूप से और कुशलतापूर्वक LLMs चलाने की सुविधा देता है।
★ 1,094+13पिछले 7 दिनों में स्टार का बदलाव - #21
🎤 Lobe TTS - सर्वर और ब्राउज़र के लिए एक उच्च-गुणवत्ता और विश्वसनीय TTS/STT लाइब्रेरी
★ 805+1पिछले 7 दिनों में स्टार का बदलाव - #22
🎙️ एक इंटेलिजेंट वॉयस प्रोडक्टिविटी असिस्टेंट जो स्पीच को साफ टेक्स्ट, उपयोगी कार्यों और संरचित ज्ञान में बदलता है। यह उपयोगकर्ताओं को विचारों को कैप्चर करने, स्वाभाविक रूप से संवाद करने, दोहराव वाले कार्यों को स्वचालित करने और विभिन्न ऐप्स और वर्कफ़्लो में उत्पादक बने रहने में मदद करता है।
★ 804+3पिछले 7 दिनों में स्टार का बदलाव - #23
Speech to Text to Speech। गाना अभी चल रहा है। अवतार पर प्रदर्शित करने के लिए टेक्स्ट को OSC संदेशों के रूप में VRChat पर भेजता है। (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 802+3पिछले 7 दिनों में स्टार का बदलाव - #24
Apple Silicon पर MLX के साथ ऑडियो प्रोसेसिंग के लिए एक मॉड्यूलर Swift SDK
★ 772+6पिछले 7 दिनों में स्टार का बदलाव - #25
Unity3d में स्थानीय मशीन पर स्पीच-टू-टेक्स्ट मॉडल (whisper.cpp) चलाना।
★ 751+1पिछले 7 दिनों में स्टार का बदलाव - #26
MLX Omni Server Apple के MLX फ्रेमवर्क द्वारा संचालित एक लोकल इन्फरेंस सर्वर है, जिसे विशेष रूप से Apple Silicon (M-series) चिप्स के लिए डिज़ाइन किया गया है। यह OpenAI-संगत API एंडपॉइंट्स को लागू करता है, जो लोकल ML इन्फरेंस की शक्ति का लाभ उठाते हुए मौजूदा OpenAI SDK क्लाइंट्स के साथ सहज एकीकरण को सक्षम बनाता है।
★ 741+1पिछले 7 दिनों में स्टार का बदलाव - #27★ 671+0पिछले 7 दिनों में स्टार का बदलाव
- #28★ 638+0पिछले 7 दिनों में स्टार का बदलाव
- #29
ऑडियो और वीडियो के स्वचालित ट्रांसक्रिप्शन को सही करने को आसान और तेज़ बनाने के लिए एक React घटक। BBC News Labs द्वारा। - कार्य प्रगति पर है
★ 620-1पिछले 7 दिनों में स्टार का बदलाव - #30
बहुभाषी ASR और TTS मॉडल के लिए C++ ggml रनटाइम हब: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, आदि, साथ ही यूनिवर्सल फोर्स्ड अलाइनमेंट और बहुत कुछ।
★ 609+21पिछले 7 दिनों में स्टार का बदलाव