speech
speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर speech के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और speech टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
🐸💬 - Text-to-Speech के लिए एक डीप लर्निंग टूलकिट, जो रिसर्च और प्रोडक्शन में परखा हुआ है
★ 45,985+18पिछले 7 दिनों में स्टार का बदलाव - #2
🚀रियल-टाइम में मनमाना भाषण उत्पन्न करने के लिए 5 सेकंड में आवाज़ क्लोन करें
★ 36,912+0पिछले 7 दिनों में स्टार का बदलाव - #3
VoxCPM2: बहुभाषी भाषण निर्माण, रचनात्मक आवाज़ डिज़ाइन, और वास्तविक क्लोनिंग के लिए टोकनराइज़र-मुक्त TTS
★ 36,595+345पिछले 7 दिनों में स्टार का बदलाव - #4★ 23,864+61पिछले 7 दिनों में स्टार का बदलाव
- #5
🤗 AI मॉडल के लिए उपयोग के लिए तैयार डेटासेट का सबसे बड़ा केंद्र, जिसमें तेज़, उपयोग में आसान और कुशल डेटा हेरफेर टूल हैं
★ 21,888+10पिछले 7 दिनों में स्टार का बदलाव - #6
Grounded SAM: Grounding DINO को Segment Anything, Stable Diffusion और Recognize Anything के साथ जोड़ना - स्वचालित रूप से कुछ भी डिटेक्ट, सेगमेंट और जनरेट करें।
★ 17,719+6पिछले 7 दिनों में स्टार का बदलाव - #7★ 15,474+3पिछले 7 दिनों में स्टार का बदलाव
- #8
ओपन-सोर्स मॉडल के साथ वॉयस एजेंट बनाएं
★ 13,015+82पिछले 7 दिनों में स्टार का बदलाव - #9★ 10,168+2पिछले 7 दिनों में स्टार का बदलाव
- #10
Silero VAD: पूर्व-प्रशिक्षित एंटरप्राइज़-ग्रेड वॉयस एक्टिविटी डिटेक्टर
★ 10,112+29पिछले 7 दिनों में स्टार का बदलाव - #11
ModelScope: Model-as-a-Service की अवधारणा को साकार करना।
★ 9,121+4पिछले 7 दिनों में स्टार का बदलाव - #12
EmotiVoice 😊: एक बहु-आवाज़ और प्रॉम्प्ट-नियंत्रित TTS इंजन
★ 8,522-1पिछले 7 दिनों में स्टार का बदलाव - #13
आधिकारिक तौर पर बनाए रखा गया, PaddlePaddle द्वारा समर्थित, जिसमें CV, NLP, Speech, Rec, TS, बड़े मॉडल आदि शामिल हैं।
★ 6,933+1पिछले 7 दिनों में स्टार का बदलाव - #14★ 6,815-1पिछले 7 दिनों में स्टार का बदलाव
- #15
Silero मॉडल: प्री-ट्रेनिंग टेक्स्ट-टू-स्पीच मॉडल जिन्हें अत्यंत सरल बनाया गया है
★ 6,084-1पिछले 7 दिनों में स्टार का बदलाव - #16
मोबाइल, पहनने योग्य उपकरणों, स्मार्ट होम और रोबोट के लिए क्वांटाइजेशन, कर्नेल, रनटाइम और अनुमान इंजन।
★ 5,975+20पिछले 7 दिनों में स्टार का बदलाव - #17
OpenAI Whisper के आधार पर स्पीकर डायरीज़ेशन के साथ स्वचालित वाक् पहचान
★ 5,634+1पिछले 7 दिनों में स्टार का बदलाव - #18
वॉयस रिकग्निशन टू टेक्स्ट टूल / एक ऑफ़लाइन चलने वाला स्थानीय ऑडियो-वीडियो से सबटाइटल टूल, जो json, srt सबटाइटल और सादे पाठ प्रारूप में आउटपुट देता है
★ 4,780+9पिछले 7 दिनों में स्टार का बदलाव - #19
डीप फ़िल्टरिंग का उपयोग करके शोर दमन
★ 4,655+19पिछले 7 दिनों में स्टार का बदलाव - #20★ 4,562+6पिछले 7 दिनों में स्टार का बदलाव
- #21
एक AI-संचालित स्पीच प्रोसेसिंग टूलकिट और ओपन सोर्स SOTA प्रीट्रेनड मॉडल, जो स्पीच एन्हांसमेंट, सेपरेशन और टारगेट स्पीकर एक्सट्रैक्शन आदि का समर्थन करते हैं।
★ 4,458+9पिछले 7 दिनों में स्टार का बदलाव - #22
मानव-जैसी, अभिव्यक्तfमक TTS के लिए फ़ाउंडेशनल मॉडल
★ 4,203-1पिछले 7 दिनों में स्टार का बदलाव - #23
उपयोग में आसानी और प्रदर्शन पर केंद्रित एक सरल, उच्च-गुणवत्ता वाला वॉयस कन्वर्जन टूल।
★ 3,674+14पिछले 7 दिनों में स्टार का बदलाव - #24
🚀 बुनियादी से लेकर उन्नत स्तर तक के बेहतरीन Python स्क्रिप्ट और ऑटोमेशन टास्क स्क्रिप्ट का क्यूरेटेड संग्रह।
★ 3,664+1पिछले 7 दिनों में स्टार का बदलाव - #25
OpenAI Whisper ASR वेबसर्विस API
★ 3,328+2पिछले 7 दिनों में स्टार का बदलाव - #26
iOS 10 के नए API के लिए कोड उदाहरण।
★ 3,272-1पिछले 7 दिनों में स्टार का बदलाव - #27★ 2,933+2पिछले 7 दिनों में स्टार का बदलाव
- #28★ 2,864+0पिछले 7 दिनों में स्टार का बदलाव
- #29
aeneas एक Python/C लाइब्रेरी और टूल्स का एक सेट है जो ऑडियो और टेक्स्ट को स्वचालित रूप से सिंक करता है (जिसे फोर्स्ड अलाइनमेंट भी कहते हैं)
★ 2,862+0पिछले 7 दिनों में स्टार का बदलाव - #30
शब्द-स्तरीय टाइमस्टैम्प और कॉन्फिडेंस के साथ बहुभाषी स्वचालित वाक् पहचान (Multilingual ASR)
★ 2,842+1पिछले 7 दिनों में स्टार का बदलाव