text-to-speech
text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #61★ 1,837+0पिछले 7 दिनों में स्टार का बदलाव
- #62
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Android के लिए Alan AI SDK
★ 1,807+0पिछले 7 दिनों में स्टार का बदलाव - #63★ 1,774+0पिछले 7 दिनों में स्टार का बदलाव
- #64
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Flutter के लिए Alan AI SDK
★ 1,756+0पिछले 7 दिनों में स्टार का बदलाव - #65
सबटाइटल फ़ाइल के आधार पर वीडियो के पाठ का स्वचालित रूप से अनुवाद करता है, और फिर उपशीर्षक के समय का उपयोग करके भाषण को सिंक्रनाइज़ किए जाने वाले एक नया डब और अनुवादित ऑडियो ट्रैक बनाने के लिए AI आवाज सेवाओं का उपयोग करता है।
★ 1,746+0पिछले 7 दिनों में स्टार का बदलाव - #66
एक बेहतरीन ब्राउज़र एक्सटेंशन जो एक क्लिक में वेबपेज सामग्री को बोलकर पढ़ता है।
★ 1,742+0पिछले 7 दिनों में स्टार का बदलाव - #67
ExecuTorch द्वारा संचालित, React Native में डिवाइस पर AI मॉडल चलाने का घोषणात्मक तरीका।
★ 1,730+0पिछले 7 दिनों में स्टार का बदलाव - #68
आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Ionic के लिए Alan AI SDK
★ 1,649+0पिछले 7 दिनों में स्टार का बदलाव - #69
Pytorch के साथ अनौपचारिक Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN)।
★ 1,645+0पिछले 7 दिनों में स्टार का बदलाव - #70
Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।
★ 1,633+0पिछले 7 दिनों में स्टार का बदलाव - #71
विषय → कोडिंग एजेंटों के लिए 4K नैरेटेड वीडियो। v4.0: ttsCN इंजन घटक के माध्यम से सभी TTS (11 प्लेटफ़ॉर्म जिनमें MiniMax वॉयस क्लोन, मूल शब्द-स्तरीय उपशीर्षक सिंक शामिल हैं), मैनिफेस्ट-आधारित एसेट इंजन, Remotion कंपोज़िशन, लागत-नियंत्रित AI जनरेशन
★ 1,608+0पिछले 7 दिनों में स्टार का बदलाव - #72★ 1,584+0पिछले 7 दिनों में स्टार का बदलाव
- #73
आधिकारिक MiniMax Model Context Protocol (MCP) सर्वर जो शक्तिशाली Text to Speech, इमेज जनरेशन और वीडियो जनरेशन API के साथ इंटरैक्शन सक्षम बनाता है।
★ 1,579+0पिछले 7 दिनों में स्टार का बदलाव - #74
Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।
★ 1,568+0पिछले 7 दिनों में स्टार का बदलाव - #75
Microsoft के VibeVoice टेक्स्ट-टू-स्पीच मॉडल के लिए एक व्यापक ComfyUI इंटीग्रेशन, जो सीधे आपके ComfyUI वर्कफ़्लो के भीतर उच्च-गुणवत्ता वाले सिंगल और मल्टी-स्पीकर वॉयस सिंथेसिस को सक्षम बनाता है।
★ 1,560+0पिछले 7 दिनों में स्टार का बदलाव - #76
Talking Head (3D): फुल-बॉडी 3D अवतारों का उपयोग करके रीयल-टाइम लिप-सिंक के लिए एक JavaScript क्लास।
★ 1,544+0पिछले 7 दिनों में स्टार का बदलाव - #77
शक्तिशाली Chatterbox TTS मॉडल को सेल्फ-हॉस्ट करें। यह सर्वर एक उपयोगकर्ता के अनुकूल Web UI, लचीले API एंडपॉइंट (OpenAI संगत सहित), पूर्वनिर्धारित आवाज़ें, वॉयस क्लोनिंग, और बड़े ऑडियोबुक-स्केल टेक्स्ट प्रोसेसिंग प्रदान करता है। NVIDIA (CUDA), AMD (ROCm), और CPU पर त्वरित रूप से चलता है।
★ 1,440+0पिछले 7 दिनों में स्टार का बदलाव - #78★ 1,439+0पिछले 7 दिनों में स्टार का बदलाव
- #79
मानव आवाज़ों को आसानी से सिंथेटिक रूप से उत्पन्न करने के लिए एक Python/Pytorch ऐप
★ 1,437+0पिछले 7 दिनों में स्टार का बदलाव - #80
🍦 Speech-AI-Forge एक प्रोजेक्ट है जिसे TTS जनरेशन मॉडल के चारों ओर विकसित किया गया है, जो एक API सर्वर और Gradio-आधारित WebUI को लागू करता है।
★ 1,420+0पिछले 7 दिनों में स्टार का बदलाव - #81
वीडियो के लिए सिंक्रोनाइज्ड ट्रांसलेशन। वीडियो डबिंग
★ 1,414+0पिछले 7 दिनों में स्टार का बदलाव - #82
Apple Silicon वाले Mac पर LLM को फाइन-ट्यून करें। SFT, DPO, GRPO, Vision, TTS, STT, Embedding और OCR फाइन-ट्यूनिंग — MLX पर नेटिव रूप से। Unsloth-compatible API।
★ 1,404+0पिछले 7 दिनों में स्टार का बदलाव - #83
💎 ASR, TTS और अन्य Speech Technologies के लिए एक्सेसिबल स्पीच कॉर्पोरा की एक सूची
★ 1,402+0पिछले 7 दिनों में स्टार का बदलाव - #84
MOSS-TTSD एक स्पोकन डायलॉग जनरेशन मॉडल है जिसे expressive multi-speaker synthesis के लिए डिज़ाइन किया गया है। इसमें long-context modeling, flexible speaker control और multilingual support शामिल है, साथ ही यह छोटे ऑडियो संदर्भों से zero-shot voice cloning को सक्षम बनाता है।
★ 1,394+0पिछले 7 दिनों में स्टार का बदलाव - #85
[ICASSP 2024] 🍵 Matcha-TTS: सशर्त प्रवाह मिलान (conditional flow matching) के साथ एक तेज़ TTS आर्किटेक्चर
★ 1,355+0पिछले 7 दिनों में स्टार का बदलाव - #86
[ICLR 2025] ऑडियो लैंग्वेज मॉडलिंग के लिए 40/75 टोकन प्रति सेकंड के साथ SOTA डिस्क्रीट एकॉस्टिक कोडेक मॉडल
★ 1,319+0पिछले 7 दिनों में स्टार का बदलाव - #87
कला, वास्तविक समय की आवाज़ बातचीत, LLM-संचालित चैटबॉट्स और स्वचालित वर्कफ़्लो के लिए ऑफ़लाइन अनुमान इंजन
★ 1,314+0पिछले 7 दिनों में स्टार का बदलाव - #88
StreamSpeech ऑफ़लाइन और एक साथ स्पीच रिकग्निशन, स्पीच ट्रांसलेशन और स्पीच सिंथेसिस के लिए एक "ऑल इन वन" सीमलेस मॉडल है।
★ 1,289+0पिछले 7 दिनों में स्टार का बदलाव - #89
Windows, Linux और macOS के लिए अनसेंसर्ड लोकल AI स्टूडियो। इमेज जनरेशन, GGUF LLMs, टेक्स्ट-टू-स्पीच और स्पीच-टू-टेक्स्ट के लिए जीरो-सेटअप GUI।
★ 1,287+13पिछले 7 दिनों में स्टार का बदलाव - #90
इमोजी-संचालित स्टाइल नियंत्रण के साथ एक Flow Matching-आधारित Text-to-Speech मॉडल
★ 1,268+0पिछले 7 दिनों में स्टार का बदलाव