text-to-speech
text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर text-to-speech के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और text-to-speech टैग वाली रिपॉजिटरी।
- #1
एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम
★ 2,379 - #2
ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।
★ 2,214 - #3
ओपन-सोर्स, लोकल-फर्स्ट वीडियो एडिटर जहाँ क्रिएटर और AI एजेंट एक ही वास्तविक टाइमलाइन को एडिट करते हैं।
★ 798 - #4
बिना ROOT के Android के लिए ओपन-सोर्स रीयल-टाइम स्क्रीन ट्रांसलेटर, जो गेम, विज़ुअल नॉवेल और मंगा के लिए उपयुक्त है। यह ऑन-डिवाइस और क्लाउड OCR, ऑफ़लाइन LLM, विभिन्न अनुवाद सेवाओं और TTS का समर्थन करता है।
★ 794 - #5
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 542
- #1
AI बड़े मॉडलों और स्वचालित वर्कफ़्लो का उपयोग करके, एक विषय या कीवर्ड के आधार पर एक क्लिक के साथ एचडी शॉर्ट वीडियो जनरेट करें।
★ 1,19,977+1,509पिछले 7 दिनों में स्टार का बदलाव - #2
Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX और अन्य सहित LLM और डिफ़्यूज़न मॉडल को चलाने और प्रशिक्षित करने के लिए स्थानीय UI।
★ 75,515+337पिछले 7 दिनों में स्टार का बदलाव - #3
1 मिनट के वॉयस डेटा का उपयोग करके भी एक अच्छा TTS मॉडल प्रशिक्षित किया जा सकता है! (फ्यू शॉट वॉयस क्लोनिंग)
★ 61,476+138पिछले 7 दिनों में स्टार का बदलाव - #4
दुनिया का पहला ओपन-सोर्स, एजेंटिक वीडियो प्रोडक्शन सिस्टम। 12 प्रोडक्शन पाइपलाइन, 100+ टूल, 700+ एजेंट स्किल और प्रोडक्शन-नॉलेज फाइलें। अपने AI कोडिंग असिस्टेंट को एक पूर्ण वीडियो प्रोडक्शन स्टूडियो में बदलें।
★ 55,719+1,707पिछले 7 दिनों में स्टार का बदलाव - #5
🐸💬 - Text-to-Speech के लिए एक डीप लर्निंग टूलकिट, जो रिसर्च और प्रोडक्शन में परखा हुआ है
★ 45,985+18पिछले 7 दिनों में स्टार का बदलाव - #6★ 39,814+9पिछले 7 दिनों में स्टार का बदलाव
- #7★ 37,419+61पिछले 7 दिनों में स्टार का बदलाव
- #8
🚀रियल-टाइम में मनमाना भाषण उत्पन्न करने के लिए 5 सेकंड में आवाज़ क्लोन करें
★ 36,912+0पिछले 7 दिनों में स्टार का बदलाव - #9
VoxCPM2: बहुभाषी भाषण निर्माण, रचनात्मक आवाज़ डिज़ाइन, और वास्तविक क्लोनिंग के लिए टोकनराइज़र-मुक्त TTS
★ 36,595+345पिछले 7 दिनों में स्टार का बदलाव - #10★ 23,686+109पिछले 7 दिनों में स्टार का बदलाव
- #11
बहु-भाषी बड़ा वॉइस जनरेशन मॉडल, जो इन्फेरेंस, ट्रेनिंग और डिप्लॉयमेंट की फुल-स्टैक क्षमता प्रदान करता है।
★ 23,426+359पिछले 7 दिनों में स्टार का बदलाव - #12★ 19,387+2पिछले 7 दिनों में स्टार का बदलाव
- #13
वीडियो को एक भाषा से दूसरी भाषा में अनुवादित करें और डबिंग व उपशीर्षक (subtitles) एम्बेड करें।
★ 18,871+38पिछले 7 दिनों में स्टार का बदलाव - #14★ 17,476+1पिछले 7 दिनों में स्टार का बदलाव
- #15
VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।
★ 14,835+2,880पिछले 7 दिनों में स्टार का बदलाव - #16
बिना इंटरनेट कनेक्शन के onnxruntime के साथ नेक्स्ट-जेन Kaldi का उपयोग करके स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच, स्पीकर डायराइजेशन, स्पीच एन्हांसमेंट, सोर्स सेपरेशन और VAD। एम्बेडेड सिस्टम, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 सर्वर, वेबसॉकेट सर्वर/क्लाइंट और 12 प्रोग्रामिंग भाषाओं का समर्थन करता है।
★ 14,575+95पिछले 7 दिनों में स्टार का बदलाव - #17
बिजली की गति वाला, ऑन-डिवाइस, बहुभाषी TTS — जो ONNX के माध्यम से नेटिव रूप से चलता है।
★ 13,757+20पिछले 7 दिनों में स्टार का बदलाव - #18
क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।
★ 12,730+54पिछले 7 दिनों में स्टार का बदलाव - #19
Microsoft Edge या Windows या API की की आवश्यकता के बिना Python से Microsoft Edge की ऑनलाइन टेक्स्ट-टू-स्पीच सेवा का उपयोग करें।
★ 11,847+29पिछले 7 दिनों में स्टार का बदलाव - #20
Amphion (/æmˈfaɪən/) ऑडियो, म्यूजिक और स्पीच जनरेशन के लिए एक टूलकिट है। इसका उद्देश्य पुनरुत्पादनीय अनुसंधान (reproducible research) का समर्थन करना और नए शोधकर्ताओं व इंजीनियरों को ऑडियो, म्यूजिक और स्पीच जनरेशन के क्षेत्र में शुरुआत करने में मदद करना है।
★ 10,276+1पिछले 7 दिनों में स्टार का बदलाव - #21★ 9,949+3पिछले 7 दिनों में स्टार का बदलाव
- #22
EmotiVoice 😊: एक बहु-आवाज़ और प्रॉम्प्ट-नियंत्रित TTS इंजन
★ 8,522-1पिछले 7 दिनों में स्टार का बदलाव - #23
Apple के MLX फ्रेमवर्क पर बनी एक टेक्स्ट-टू-स्पीच (TTS), स्पीच-टू-टेक्स्ट (STT) और स्पीच-टू-स्पीच (STS) लाइब्रेरी, जो Apple Silicon पर कुशल भाषण विश्लेषण प्रदान करती है।
★ 7,826+23पिछले 7 दिनों में स्टार का बदलाव - #24
MyShell.ai द्वारा उच्च-गुणवत्ता वाली बहुभाषी टेक्स्ट-टू-स्पीच लाइब्रेरी। अंग्रेजी, स्पेनिश, फ्रेंच, चीनी, जापानी और कोरियाई का समर्थन करती है।
★ 7,616+7पिछले 7 दिनों में स्टार का बदलाव - #25
eSpeak NG एक ओपन सोर्स स्पीच सिंथेसाइज़र है जो सौ से अधिक भाषाओं और लहजों का समर्थन करता है।
★ 6,802+13पिछले 7 दिनों में स्टार का बदलाव - #26
Apple Silicon के लिए ऑन-डिवाइस स्पीच AI
★ 6,353+8पिछले 7 दिनों में स्टार का बदलाव - #27
StyleTTS 2: लार्ज स्पीच लैंग्वेज मॉडल के साथ स्टाइल डिफ़्यूज़न और एडवरसरियल ट्रेनिंग के माध्यम से मानव-स्तरीय टेक्स्ट-टू-स्पीच की ओर
★ 6,342+3पिछले 7 दिनों में स्टार का बदलाव - #28
इस रिपॉजिटरी में Generative Pre-trained Transformer (GPT), ChatGPT, PaLM आदि पर ध्यान केंद्रित करते हुए Prompt Engineering के लिए चुनिंदा संसाधन शामिल हैं
★ 6,306+7पिछले 7 दिनों में स्टार का बदलाव - #29
Silero मॉडल: प्री-ट्रेनिंग टेक्स्ट-टू-स्पीच मॉडल जिन्हें अत्यंत सरल बनाया गया है
★ 6,084-1पिछले 7 दिनों में स्टार का बदलाव - #30
अपने PC, Mac, या Linux बॉक्स को AI सर्वर में बदलें। LLM इन्फेंस, चैट UI, वॉयस, एजेंट, वर्कफ़्लो, RAG, और इमेज जनरेशन।
★ 5,931+1,108पिछले 7 दिनों में स्टार का बदलाव