text-to-speech
text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31★ 5,831+0पिछले 7 दिनों में स्टार का बदलाव
- #32
ओपन सोर्स वॉयस AI प्लेटफॉर्म। Vapi और Retell का सेल्फ-होस्टेड विकल्प। ऑन-प्रेम, स्पीच-टू-स्पीच या LLM/STT/TTS में BYOK, विजुअल वर्कफ्लो बिल्डर, MCP नेटिव और टेलीफोनी सहायता के साथ।
★ 5,568+0पिछले 7 दिनों में स्टार का बदलाव - #33
ओपन-सोर्स AI वीडियो लोकलाइजेशन टूल: YouTube/Bilibili वीडियो डाउनलोड, उपशीर्षक पहचान और अनुवाद, वॉयस क्लोनिंग डबिंग, ऑडियो ट्रैक मिक्सिंग और उपशीर्षक बर्निंग को स्वचालित रूप से पूरा करता है।
★ 5,404+0पिछले 7 दिनों में स्टार का बदलाव - #34
Kokoro-82M टेक्स्ट-टू-स्पीच के लिए डॉक्युराइज्ड OpenAI-संगत रैपर, मल्टीप्लैटफॉर्म CPU, AMD, NVIDIA GPU PyTorch; मल्टी-स्पीकर, वॉयस-मिक्सिंग, ऑटो-स्टिचिंग, कैप्शन टाइमस्टैम्प, SSML, रीडअलांग वेब UI के साथ
★ 5,399+0पिछले 7 दिनों में स्टार का बदलाव - #35
DiffSinger: शैलो डिफ्यूजन तंत्र (SVS & TTS) के माध्यम से सिंगिंग वॉयस सिंथेसिस; AAAI 2022; आधिकारिक कोड
★ 4,855+0पिछले 7 दिनों में स्टार का बदलाव - #36★ 4,624+0पिछले 7 दिनों में स्टार का बदलाव
- #37
OpenAI के Whisper का लगभग-लाइव कार्यान्वयन।
★ 4,246+0पिछले 7 दिनों में स्टार का बदलाव - #38
मानव-जैसी, अभिव्यक्तfमक TTS के लिए फ़ाउंडेशनल मॉडल
★ 4,203+0पिछले 7 दिनों में स्टार का बदलाव - #39
MOSS‑TTS Family MOSI.AI और OpenMOSS टीम का एक ओपन‑सोर्स स्पीच और साउंड जनरेशन मॉडल परिवार है। इसे उच्च-निष्ठा, उच्च-अभिव्यक्ति और जटिल वास्तविक दुनिया के परिदृश्यों के लिए डिज़ाइन किया गया है, जिसमें स्थिर लॉन्ग-फॉर्म स्पीच, मल्टी-स्पीकर संवाद, आवाज़/कैरेक्टर डिज़ाइन, पर्यावरण ध्वनि प्रभाव और वास्तविक समय स्ट्रीमिंग TTS शामिल हैं।
★ 4,058+0पिछले 7 दिनों में स्टार का बदलाव - #40
रीयलटाइम में टेक्स्ट को स्पीच में बदलता है
★ 4,021+0पिछले 7 दिनों में स्टार का बदलाव - #41
:stuck_out_tongue_closed_eyes: TensorFlowTTS: Tensorflow 2 के लिए रियल-टाइम अत्याधुनिक स्पीच सिंथेसिस (अंग्रेजी, फ्रेंच, कोरियाई, चीनी, जर्मन सहित समर्थित और अन्य भाषाओं के लिए अनुकूलित करना आसान)
★ 3,996+0पिछले 7 दिनों में स्टार का बदलाव - #42
उपयोग में आसानी और प्रदर्शन पर केंद्रित एक सरल, उच्च-गुणवत्ता वाला वॉयस कन्वर्जन टूल।
★ 3,674+0पिछले 7 दिनों में स्टार का बदलाव - #43
ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, और Bark के लिए एक्सटेंशन के साथ एक एकल Gradio + React WebUI!
★ 3,250+0पिछले 7 दिनों में स्टार का बदलाव - #44
ElevenLabs API के लिए आधिकारिक Python SDK।
★ 3,083+0पिछले 7 दिनों में स्टार का बदलाव - #45
[AutoArk] GPA (General Purpose Audio) एक छोटे मॉडल के साथ ASR, TTS और वॉयस कन्वर्जन कर सकता है!
★ 3,061+0पिछले 7 दिनों में स्टार का बदलाव - #46
aeneas एक Python/C लाइब्रेरी और टूल्स का एक सेट है जो ऑडियो और टेक्स्ट को स्वचालित रूप से सिंक करता है (जिसे फोर्स्ड अलाइनमेंट भी कहते हैं)
★ 2,862+0पिछले 7 दिनों में स्टार का बदलाव - #47★ 2,818+0पिछले 7 दिनों में स्टार का बदलाव
- #48
Google Translate की टेक्स्ट-टू-स्पीच API के साथ इंटरफेस करने के लिए Python लाइब्रेरी और CLI टूल।
★ 2,628+0पिछले 7 दिनों में स्टार का बदलाव - #49
🚀 एक-क्लिक पर तैनाती (ऑफ़लाइन एकीकृत पैकेज सहित)! ChatTTS पर आधारित, यह स्ट्रीमिंग आउटपुट, वॉयस कार्ड ड्रॉइंग, लंबे ऑडियो जनरेशन और रोल-आधारित रीडिंग का समर्थन करता है। उपयोग में आसान, किसी जटिल इंस्टॉलेशन की आवश्यकता नहीं है।
★ 2,593+0पिछले 7 दिनों में स्टार का बदलाव - #50
MARY TTS -- शुद्ध जावा में लिखा गया एक ओपन-सोर्स, बहुभाषी टेक्स्ट-टू-स्पीच सिंथेसिस सिस्टम
★ 2,583+0पिछले 7 दिनों में स्टार का बदलाव - #51★ 2,530+0पिछले 7 दिनों में स्टार का बदलाव
- #52
इंस्टेंट वॉइस क्लोनिंग के साथ Vietnamese TTS • ऑन-डिवाइस • रियल-टाइम CPU इन्फरेंस • 24kHz ऑडियो क्वालिटी • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt
★ 2,468+0पिछले 7 दिनों में स्टार का बदलाव - #53
एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम
★ 2,379+58पिछले 7 दिनों में स्टार का बदलाव - #54★ 2,367+0पिछले 7 दिनों में स्टार का बदलाव
- #55
VALL-E (ज़ीरो-शॉट टेक्स्ट-टू-स्पीच) का PyTorch कार्यान्वयन, पुनरुत्पादित डेमो https://lifeiteng.github.io/valle/index.html
★ 2,215+0पिछले 7 दिनों में स्टार का बदलाव - #56
ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।
★ 2,214+0पिछले 7 दिनों में स्टार का बदलाव - #57
7000 से अधिक भाषाओं के लिए नियंत्रणीय और तेज़ Text-to-Speech!
★ 2,207+0पिछले 7 दिनों में स्टार का बदलाव - #58
OpenAI, Azure, या ElevenLabs को बदलने के लिए मुफ़्त, उच्च-गुणवत्ता वाला text-to-speech API एंडपॉइंट
★ 2,075+0पिछले 7 दिनों में स्टार का बदलाव - #59★ 2,048+0पिछले 7 दिनों में स्टार का बदलाव
- #60
Claude Code के लिए AI-नेटिव वीडियो प्रोडक्शन टूलकिट
★ 2,036+0पिछले 7 दिनों में स्टार का बदलाव