voice-cloning
voice-cloning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर voice-cloning के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और voice-cloning टैग वाली रिपॉजिटरी।
- #1
1 मिनट के वॉयस डेटा का उपयोग करके भी एक अच्छा TTS मॉडल प्रशिक्षित किया जा सकता है! (फ्यू शॉट वॉयस क्लोनिंग)
★ 61,476+138पिछले 7 दिनों में स्टार का बदलाव - #2
रीयल-टाइम में मनचाहा भाषण जनरेट करने के लिए 5 सेकंड में आवाज़ क्लोन करें
★ 60,117-4पिछले 7 दिनों में स्टार का बदलाव - #3
🐸💬 - Text-to-Speech के लिए एक डीप लर्निंग टूलकिट, जो रिसर्च और प्रोडक्शन में परखा हुआ है
★ 45,985+18पिछले 7 दिनों में स्टार का बदलाव - #4
VoxCPM2: बहुभाषी भाषण निर्माण, रचनात्मक आवाज़ डिज़ाइन, और वास्तविक क्लोनिंग के लिए टोकनराइज़र-मुक्त TTS
★ 36,595+345पिछले 7 दिनों में स्टार का बदलाव - #5
बहु-भाषी बड़ा वॉइस जनरेशन मॉडल, जो इन्फेरेंस, ट्रेनिंग और डिप्लॉयमेंट की फुल-स्टैक क्षमता प्रदान करता है।
★ 23,426+359पिछले 7 दिनों में स्टार का बदलाव - #6
ई-बुक्स से ऑडियोबुक जेनरेट करें, वॉयस क्लोनिंग और 1158+ भाषाएँ!
★ 20,097+34पिछले 7 दिनों में स्टार का बदलाव - #7
नेटफ्लिक्स-स्तरीय उपशीर्षक कटिंग, अनुवाद, संरेखण और डबिंग - एक-क्लिक पूरी तरह से स्वचालित AI वीडियो उपशीर्षक टीम
★ 18,339+49पिछले 7 दिनों में स्टार का बदलाव - #8
VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।
★ 14,835+2,880पिछले 7 दिनों में स्टार का बदलाव - #9
क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।
★ 12,730+54पिछले 7 दिनों में स्टार का बदलाव - #10
उपयोग में आसान स्पीच टूलकिट जिसमें सेल्फ-सुपरवाइज्ड लर्निंग मॉडल, विराम चिह्नों के साथ SOTA/स्ट्रीमिंग ASR, टेक्स्ट फ्रंटएंड के साथ स्ट्रीमिंग TTS, स्पीकर वेरिफिकेशन सिस्टम, एंड-टू-एंड स्पीच ट्रांसलेशन और कीवर्ड स्पॉटिंग शामिल है। NAACL2022 बेस्ट डेमो अवार्ड जीता।
★ 12,676+5पिछले 7 दिनों में स्टार का बदलाव - #11
YuE: ओपन फुल-सॉन्ग म्यूज़िक जनरेशन फाउंडेशन मॉडल, Suno.ai जैसा कुछ लेकिन ओपन
★ 6,416+8पिछले 7 दिनों में स्टार का बदलाव - #12
ओपन-सोर्स AI वीडियो लोकलाइजेशन टूल: YouTube/Bilibili वीडियो डाउनलोड, उपशीर्षक पहचान और अनुवाद, वॉयस क्लोनिंग डबिंग, ऑडियो ट्रैक मिक्सिंग और उपशीर्षक बर्निंग को स्वचालित रूप से पूरा करता है।
★ 5,404+25पिछले 7 दिनों में स्टार का बदलाव - #13
MOSS‑TTS Family MOSI.AI और OpenMOSS टीम का एक ओपन‑सोर्स स्पीच और साउंड जनरेशन मॉडल परिवार है। इसे उच्च-निष्ठा, उच्च-अभिव्यक्ति और जटिल वास्तविक दुनिया के परिदृश्यों के लिए डिज़ाइन किया गया है, जिसमें स्थिर लॉन्ग-फॉर्म स्पीच, मल्टी-स्पीकर संवाद, आवाज़/कैरेक्टर डिज़ाइन, पर्यावरण ध्वनि प्रभाव और वास्तविक समय स्ट्रीमिंग TTS शामिल हैं।
★ 4,058+18पिछले 7 दिनों में स्टार का बदलाव - #14
उपयोग में आसानी और प्रदर्शन पर केंद्रित एक सरल, उच्च-गुणवत्ता वाला वॉयस कन्वर्जन टूल।
★ 3,674+14पिछले 7 दिनों में स्टार का बदलाव - #15★ 2,818+1पिछले 7 दिनों में स्टार का बदलाव
- #16
ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।
★ 2,214+115पिछले 7 दिनों में स्टार का बदलाव - #17★ 1,760+3पिछले 7 दिनों में स्टार का बदलाव
- #18
आधिकारिक MiniMax Model Context Protocol (MCP) सर्वर जो शक्तिशाली Text to Speech, इमेज जनरेशन और वीडियो जनरेशन API के साथ इंटरैक्शन सक्षम बनाता है।
★ 1,573+2पिछले 7 दिनों में स्टार का बदलाव - #19
Microsoft के VibeVoice टेक्स्ट-टू-स्पीच मॉडल के लिए एक व्यापक ComfyUI इंटीग्रेशन, जो सीधे आपके ComfyUI वर्कफ़्लो के भीतर उच्च-गुणवत्ता वाले सिंगल और मल्टी-स्पीकर वॉयस सिंथेसिस को सक्षम बनाता है।
★ 1,555+4पिछले 7 दिनों में स्टार का बदलाव - #20
मानव आवाज़ों को आसानी से सिंथेटिक रूप से उत्पन्न करने के लिए एक Python/Pytorch ऐप
★ 1,440+0पिछले 7 दिनों में स्टार का बदलाव - #21
शक्तिशाली Chatterbox TTS मॉडल को सेल्फ-हॉस्ट करें। यह सर्वर एक उपयोगकर्ता के अनुकूल Web UI, लचीले API एंडपॉइंट (OpenAI संगत सहित), पूर्वनिर्धारित आवाज़ें, वॉयस क्लोनिंग, और बड़े ऑडियोबुक-स्केल टेक्स्ट प्रोसेसिंग प्रदान करता है। NVIDIA (CUDA), AMD (ROCm), और CPU पर त्वरित रूप से चलता है।
★ 1,427+1पिछले 7 दिनों में स्टार का बदलाव - #22
💎 ASR, TTS और अन्य Speech Technologies के लिए एक्सेसिबल स्पीच कॉर्पोरा की एक सूची
★ 1,399+0पिछले 7 दिनों में स्टार का बदलाव - #23
द्विभाषी एपिसोड के लिए AI पॉडकास्ट जेनरेटर, बहु-भाषाएँ, NotebookLLM का विकल्प; मानव जैसी बातचीत वाला AI पॉडकास्ट जेनरेटर, कई भाषाएँ और आवाज़ें।
★ 1,289-1पिछले 7 दिनों में स्टार का बदलाव - #24
विभिन्न ऑडियो-संबंधित Neural Networks के लिए एक webui
★ 1,246+0पिछले 7 दिनों में स्टार का बदलाव - #25
इमोजी-संचालित स्टाइल नियंत्रण के साथ एक Flow Matching-आधारित Text-to-Speech मॉडल
★ 1,228+4पिछले 7 दिनों में स्टार का बदलाव - #26
स्थानीय मल्टी-इंजन मल्टी-लैंग्वेज टेक्स्ट-टू-स्पीच और वॉयस कन्वर्जन के लिए एक ComfyUI कस्टम नोड इंटीग्रेशन। समर्थित: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (क्लासिक और बहुभाषी), F5-TTS, Higgs Audio 2, 3, और असीमित टेक्स्ट लंबाई, SRT टाइमिंग, कैरेक्टर सपोर्ट और कई ऑडियो टूल के साथ VibeVoice
★ 1,187+7पिछले 7 दिनों में स्टार का बदलाव - #27
Apple Silicon के लिए नेटिव LLM इन्फरेंस सर्वर। OpenAI और Anthropic API के साथ संगत। Python की आवश्यकता नहीं। इसमें चैट, एजेंट मोड और टूल कॉलिंग के साथ MLX Core macOS ऐप शामिल है।
★ 1,115+245पिछले 7 दिनों में स्टार का बदलाव - #28
AI-संचालित मल्टी-वॉयस ऑडियोबुक जनरेटर — LLM स्क्रिप्ट एनोटेशन, वॉयस क्लोनिंग, वॉयस डिज़ाइन, LoRA ट्रेनिंग, प्रति-लाइन स्टाइल नियंत्रण, और MP3, चैप्टर वाले M4B या Audacity मल्टी-ट्रैक में निर्यात। Qwen3-TTS पर निर्मित
★ 999+17पिछले 7 दिनों में स्टार का बदलाव - #29
एक शक्तिशाली 3B-पैरामीटर, LLM-आधारित रीइन्फोर्समेंट लर्निंग ऑडियो एडिट मॉडल, जो भावना, बोलने की शैली और पैरालिंग्विस्टिक्स को एडिट करने में उत्कृष्ट है, और इसमें मजबूत ज़ीरो-शॉट टेक्स्ट-टू-स्पीच की सुविधा है।
★ 972+1पिछले 7 दिनों में स्टार का बदलाव - #30
एक हल्का, ऑफ़लाइन Android टेक्स्ट-टू-स्पीच (TTS) इंजन जो निर्बाध सिस्टम-व्यापी वॉयस क्लोनिंग और उच्च-निष्ठा टेक्स्ट रीडिंग को सक्षम बनाता है।
★ 803+2पिछले 7 दिनों में स्टार का बदलाव