text-to-speech
text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #121
Flutter टेक्स्ट-टू-स्पीच पैकेज
★ 753+0पिछले 7 दिनों में स्टार का बदलाव - #122
🔊 Kokoro Web: मुफ्त AI टेक्स्ट-टू-स्पीच, ऑनलाइन या सेल्फ-होस्टेड, OpenAI के साथ संगत!
★ 733+2पिछले 7 दिनों में स्टार का बदलाव - #123
Rapida एक ओपन-सोर्स, एंड-टू-एंड वॉयस AI ऑर्केस्ट्रेशन प्लेटफ़ॉर्म है, जो ऑडियो स्ट्रीमिंग, STT, TTS, VAD, मल्टी-चैनल इंटीग्रेशन, एजेंट स्टेट मैनेजमेंट और ऑब्जर्वेबिलिटी के साथ रीयल-टाइम संवादात्मक वॉयस एजेंट बनाने के लिए है।
★ 723+4पिछले 7 दिनों में स्टार का बदलाव - #124★ 718-1पिछले 7 दिनों में स्टार का बदलाव
- #125
Pytorch में MetaAI से Voicebox, नए SOTA Text-to-speech नेटवर्क का कार्यान्वयन
★ 703+0पिछले 7 दिनों में स्टार का बदलाव - #126
न्यूज़लेटर्स को दैनिक YouTube वीडियो में बदलने के लिए मोशन ग्राफिक्स और टेक्स्ट-टू-स्पीच सिंथेसिस का उपयोग करने वाला पूरी तरह से स्वचालित वीडियो मेकर।
★ 703+0पिछले 7 दिनों में स्टार का बदलाव - #127
Android के लिए OpenAI Whisper और TensorFlow Lite के साथ ऑफ़लाइन वाक् पहचान (Speech Recognition)
★ 689+1पिछले 7 दिनों में स्टार का बदलाव - #128
Chatterbox का उपयोग करने वाला लोकल, OpenAI-compatible टेक्स्ट-टू-स्पीच (TTS) API, जो उपयोगकर्ताओं को कहीं भी वॉयस क्लोन स्पीच जेनरेट करने की अनुमति देता है जहाँ OpenAI API का उपयोग किया जाता है (जैसे Open WebUI, AnythingLLM, आदि)।
★ 677+1पिछले 7 दिनों में स्टार का बदलाव - #129
📚 एक कस्टमाइज़ करने योग्य डिक्शनरी एक्सटेंशन जो 20+ भाषाओं, 1000+ शब्दकोशों, टेक्स्ट-टू-स्पीच, अनुवाद और Anki एकीकरण में डबल-क्लिक लुकअप को सपोर्ट करता है।
★ 671+1पिछले 7 दिनों में स्टार का बदलाव - #130
LLaSA: LLaMA-आधारित स्पीच सिंथेसिस के लिए ट्रेन-टाइम और इन्फेरेंस-टाइम कंप्यूट को स्केल करना
★ 658+1पिछले 7 दिनों में स्टार का बदलाव - #131
MLX में F5-TTS का कार्यान्वयन।
★ 644+0पिछले 7 दिनों में स्टार का बदलाव - #132★ 626+2पिछले 7 दिनों में स्टार का बदलाव
- #133
PDF और EPUB को ऑडियोबुक में बदलें; सबटाइटल या वीडियो को डब किए गए वीडियो (अनुवाद सहित) में बदलें, और भी बहुत कुछ। मुफ्त में। Pandrator स्थानीय मॉडल का उपयोग करता है, जिसमें वॉयस-क्लोनिंग (इंस्टेंट, RVC-एन्हांस्ड, XTTS फाइन-ट्यूनिंग) और LLM प्रोसेसिंग शामिल है। यह GUI, इंस्टॉलर और ऑल-इन-वन पैकेज के साथ एक उपयोगकर्ता के अनुकूल ऐप बनने की आकांक्षा रखता है।
★ 620+3पिछले 7 दिनों में स्टार का बदलाव - #134
TikTok TTS API के साथ इंटरैक्ट करने के लिए सरल Python स्क्रिप्ट
★ 611+0पिछले 7 दिनों में स्टार का बदलाव - #135
VibeVoice TTS के लिए ComfyUI कस्टम नोड। अभिव्यंजक, लंबे-फॉर्म, मल्टी-स्पीकर संवादात्मक ऑडियो
★ 596-1पिछले 7 दिनों में स्टार का बदलाव - #136
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — React Native के लिए Alan AI SDK।
★ 575+0पिछले 7 दिनों में स्टार का बदलाव - #137
Chatterbox का संशोधित संस्करण जो इनपुट के रूप में टेक्स्ट फ़ाइलों को स्वीकार करता है और इसमें कोई वर्ण प्रतिबंध नहीं है। मैं इसका उपयोग ऑडियोबुक बनाने के लिए करता हूँ, विशेष रूप से अपने बच्चों के लिए।
★ 575-1पिछले 7 दिनों में स्टार का बदलाव - #138
Mac (M1/M2/M3/M4) पर स्थानीय रूप से Qwen3-TTS टेक्स्ट-टू-स्पीच चलाएं। वॉयस क्लोनिंग, वॉयस डिज़ाइन, कस्टम वॉयस। MLX का उपयोग करके 100% ऑफ़लाइन।
★ 561+2पिछले 7 दिनों में स्टार का बदलाव - #139
🔥🔥🔥 LLMs-आधारित मल्टीमॉडल जनरेशन (इमेज, वीडियो, 3D और ऑडियो) पर शोध पत्रों की एक क्यूरेटेड सूची।
★ 552+0पिछले 7 दिनों में स्टार का बदलाव - #140
pytorch में vits2-TTS का अनौपचारिक कार्यान्वयन
★ 549+1पिछले 7 दिनों में स्टार का बदलाव - #141
LM Studio के साथ Orpheus 3B को स्थानीय रूप से चलाएं
★ 549+0पिछले 7 दिनों में स्टार का बदलाव - #142
AI Plugin, Payload CMS के लिए एक शक्तिशाली एक्सटेंशन है, जो सामग्री निर्माण और प्रबंधन को बढ़ाने के लिए उन्नत AI क्षमताओं को एकीकृत करता है।
★ 548-1पिछले 7 दिनों में स्टार का बदलाव - #143
macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ
★ 547+13पिछले 7 दिनों में स्टार का बदलाव - #144
ComfyUI के लिए OmniVoice TTS नोड्स - वॉयस क्लोनिंग, वॉयस डिज़ाइन और मल्टी-स्पीकर डायलॉग के साथ ज़ीरो-शॉट बहुभाषी टेक्स्ट-टू-स्पीच।
★ 547+6पिछले 7 दिनों में स्टार का बदलाव - #145★ 525+2पिछले 7 दिनों में स्टार का बदलाव
- #146
Pytorch में E2-TTS, "Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS" का कार्यान्वयन
★ 517+0पिछले 7 दिनों में स्टार का बदलाव - #147
एक वियतनामी वॉयस क्लोनिंग टेक्स्ट-टू-स्पीच मॉडल।
★ 516-1पिछले 7 दिनों में स्टार का बदलाव - #148
ओपन सोर्स, लोकल और सेल्फ-होस्टेड अत्यधिक अनुकूलित लैंग्वेज इन्फरेंस सर्वर, जो WebRTC, REST और WS पर ASR/STT, TTS और LLM का समर्थन करता है।
★ 512+0पिछले 7 दिनों में स्टार का बदलाव - #149
अत्यधिक अभिव्यंजक स्पीच और यथार्थवादी ज़ीरो-शॉट वॉयस क्लोनिंग के लिए ComfyUI नोड
★ 509+0पिछले 7 दिनों में स्टार का बदलाव - #150
An open-source read-along document reader server with high-quality TTS options, synchronized highlighting, and audiobook export for EPUB, PDF, DOCX, TXT, and MD.
★ 505+4पिछले 7 दिनों में स्टार का बदलाव