voice-cloning
voice-cloning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
रीयल-टाइम वॉयस असिस्टेंट — WebRTC स्ट्रीमिंग, faster-whisper ASR, लोकल LLM, Vui Nano (300M) TTS। OpenAI रीयल-टाइम API संगत। वॉयस क्लोनिंग, बार्ज-इन, 4090 पर ~9× रीयल-टाइम। Apache 2.0।
★ 760+7पिछले 7 दिनों में स्टार का बदलाव - #32
MimikaStudio - macOS (Apple Silicon) के लिए एक लोकल-फर्स्ट एप्लिकेशन + Agentic MCP सपोर्ट
★ 736+4पिछले 7 दिनों में स्टार का बदलाव - #33
Chatterbox का उपयोग करने वाला लोकल, OpenAI-compatible टेक्स्ट-टू-स्पीच (TTS) API, जो उपयोगकर्ताओं को कहीं भी वॉयस क्लोन स्पीच जेनरेट करने की अनुमति देता है जहाँ OpenAI API का उपयोग किया जाता है (जैसे Open WebUI, AnythingLLM, आदि)।
★ 677+1पिछले 7 दिनों में स्टार का बदलाव - #34
PDF और EPUB को ऑडियोबुक में बदलें; सबटाइटल या वीडियो को डब किए गए वीडियो (अनुवाद सहित) में बदलें, और भी बहुत कुछ। मुफ्त में। Pandrator स्थानीय मॉडल का उपयोग करता है, जिसमें वॉयस-क्लोनिंग (इंस्टेंट, RVC-एन्हांस्ड, XTTS फाइन-ट्यूनिंग) और LLM प्रोसेसिंग शामिल है। यह GUI, इंस्टॉलर और ऑल-इन-वन पैकेज के साथ एक उपयोगकर्ता के अनुकूल ऐप बनने की आकांक्षा रखता है।
★ 622+3पिछले 7 दिनों में स्टार का बदलाव - #35
YouDub एक ओपन-सोर्स टूल है जिसे YouTube वीडियो के अनुवाद और डबिंग को स्वचालित करने के लिए डिज़ाइन किया गया है। यह AI स्पीच रिकग्निशन, LLM अनुवाद और AI वॉयस क्लोनिंग का उपयोग करके मूल YouTuber की आवाज़ में चीनी डबिंग वीडियो बनाता है।
★ 615-1पिछले 7 दिनों में स्टार का बदलाव - #36
VibeVoice TTS के लिए ComfyUI कस्टम नोड। अभिव्यंजक, लंबे-फॉर्म, मल्टी-स्पीकर संवादात्मक ऑडियो
★ 596-1पिछले 7 दिनों में स्टार का बदलाव - #37
Chatterbox का संशोधित संस्करण जो इनपुट के रूप में टेक्स्ट फ़ाइलों को स्वीकार करता है और इसमें कोई वर्ण प्रतिबंध नहीं है। मैं इसका उपयोग ऑडियोबुक बनाने के लिए करता हूँ, विशेष रूप से अपने बच्चों के लिए।
★ 575-1पिछले 7 दिनों में स्टार का बदलाव - #38
Mac (M1/M2/M3/M4) पर स्थानीय रूप से Qwen3-TTS टेक्स्ट-टू-स्पीच चलाएं। वॉयस क्लोनिंग, वॉयस डिज़ाइन, कस्टम वॉयस। MLX का उपयोग करके 100% ऑफ़लाइन।
★ 561+2पिछले 7 दिनों में स्टार का बदलाव - #39
पर्सनलाइज्ड वॉयस क्लोनिंग के साथ दुनिया का पहला ओपन-सोर्स रियल-टाइम एंड-टू-एंड स्पोकन डायलॉग मॉडल।
★ 550+1पिछले 7 दिनों में स्टार का बदलाव - #40
ComfyUI के लिए OmniVoice TTS नोड्स - वॉयस क्लोनिंग, वॉयस डिज़ाइन और मल्टी-स्पीकर डायलॉग के साथ ज़ीरो-शॉट बहुभाषी टेक्स्ट-टू-स्पीच।
★ 547+6पिछले 7 दिनों में स्टार का बदलाव - #41
अत्यधिक अभिव्यंजक स्पीच और यथार्थवादी ज़ीरो-शॉट वॉयस क्लोनिंग के लिए ComfyUI नोड
★ 509+0पिछले 7 दिनों में स्टार का बदलाव