मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · text-to-speech

text-to-speech

text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
150
कुल स्टार
9,55,097
औसत स्टार
6,367
हिस्सा
0.05%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर text-to-speech के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और text-to-speech टैग वाली रिपॉजिटरी।

  • qwen-audio-agent@QwenAudio

    एक रीयल-टाइम वॉयस रनटाइम जो एजेंट्स को बात करते, काम करते और मौजूद रखते हुए रखता है। AI एजेंट्स के लिए रीयल-टाइम वॉयस रनटाइम

    2,379
  • audio.cpp@0xShug0

    ऑडियो मॉडल के लिए एक ऑल-इन-वन, शुद्ध C++ इन्फेरेंस इंजन, जो ggml द्वारा संचालित है। अत्यधिक अनुकूलित प्रदर्शन के साथ TTS, STT, VAD, वॉयस कन्वर्शन, म्यूजिक जनरेशन और बहुत कुछ समर्थन करता है। कोई Python निर्भरता नहीं।

    2,214
  • ai-video-editor@MartinDelophy

    ओपन-सोर्स, लोकल-फर्स्ट वीडियो एडिटर जहाँ क्रिएटर और AI एजेंट एक ही वास्तविक टाइमलाइन को एडिट करते हैं।

    798
  • बिना ROOT के Android के लिए ओपन-सोर्स रीयल-टाइम स्क्रीन ट्रांसलेटर, जो गेम, विज़ुअल नॉवेल और मंगा के लिए उपयुक्त है। यह ऑन-डिवाइस और क्लाउड OCR, ऑफ़लाइन LLM, विभिन्न अनुवाद सेवाओं और TTS का समर्थन करता है।

    794
  • Talkify@tornikegomareli

    macOS के लिए बिजली की गति वाला, मुफ्त, लोकल-फर्स्ट वॉयस डिक्टेशन, ऑन-डिवाइस ट्रांसक्रिप्शन के साथ

    542
  • MoneyPrinterTurbo@harry0703

    AI बड़े मॉडलों और स्वचालित वर्कफ़्लो का उपयोग करके, एक विषय या कीवर्ड के आधार पर एक क्लिक के साथ एचडी शॉर्ट वीडियो जनरेट करें।

    1,19,977+1,509पिछले 7 दिनों में स्टार का बदलाव
  • unsloth@unslothai

    Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX और अन्य सहित LLM और डिफ़्यूज़न मॉडल को चलाने और प्रशिक्षित करने के लिए स्थानीय UI।

    75,515+337पिछले 7 दिनों में स्टार का बदलाव
  • GPT-SoVITS@RVC-Boss

    1 मिनट के वॉयस डेटा का उपयोग करके भी एक अच्छा TTS मॉडल प्रशिक्षित किया जा सकता है! (फ्यू शॉट वॉयस क्लोनिंग)

    61,476+138पिछले 7 दिनों में स्टार का बदलाव
  • OpenMontage@calesthio

    दुनिया का पहला ओपन-सोर्स, एजेंटिक वीडियो प्रोडक्शन सिस्टम। 12 प्रोडक्शन पाइपलाइन, 100+ टूल, 700+ एजेंट स्किल और प्रोडक्शन-नॉलेज फाइलें। अपने AI कोडिंग असिस्टेंट को एक पूर्ण वीडियो प्रोडक्शन स्टूडियो में बदलें।

    55,719+1,707पिछले 7 दिनों में स्टार का बदलाव
  • TTS@coqui-ai

    🐸💬 - Text-to-Speech के लिए एक डीप लर्निंग टूलकिट, जो रिसर्च और प्रोडक्शन में परखा हुआ है

    45,985+18पिछले 7 दिनों में स्टार का बदलाव
  • ChatTTS@2noise

    दैनिक बातचीत के लिए एक जनरेटिव स्पीच मॉडल।

    39,814+9पिछले 7 दिनों में स्टार का बदलाव
  • OpenVoice@myshell-ai

    MIT और MyShell द्वारा त्वरित वॉयस क्लोनिंग। ऑडियो फाउंडेशन मॉडल।

    37,419+61पिछले 7 दिनों में स्टार का बदलाव
  • MockingBird@babysor

    🚀रियल-टाइम में मनमाना भाषण उत्पन्न करने के लिए 5 सेकंड में आवाज़ क्लोन करें

    36,912+0पिछले 7 दिनों में स्टार का बदलाव
  • VoxCPM@OpenBMB

    VoxCPM2: बहुभाषी भाषण निर्माण, रचनात्मक आवाज़ डिज़ाइन, और वास्तविक क्लोनिंग के लिए टोकनराइज़र-मुक्त TTS

    36,595+345पिछले 7 दिनों में स्टार का बदलाव
  • index-tts@index-tts

    एक औद्योगिक-स्तरीय नियंत्रणीय और कुशल ज़ीरो-शॉट टेक्स्ट-टू-स्पीच सिस्टम

    23,686+109पिछले 7 दिनों में स्टार का बदलाव
  • CosyVoice@QwenAudio

    बहु-भाषी बड़ा वॉइस जनरेशन मॉडल, जो इन्फेरेंस, ट्रेनिंग और डिप्लॉयमेंट की फुल-स्टैक क्षमता प्रदान करता है।

    23,426+359पिछले 7 दिनों में स्टार का बदलाव
  • dia@nari-labs

    एक TTS मॉडल जो एक ही पास में अति-यथार्थवादी संवाद उत्पन्न करने में सक्षम है।

    19,387+2पिछले 7 दिनों में स्टार का बदलाव
  • pyvideotrans@jianchang512

    वीडियो को एक भाषा से दूसरी भाषा में अनुवादित करें और डबिंग व उपशीर्षक (subtitles) एम्बेड करें।

    18,871+38पिछले 7 दिनों में स्टार का बदलाव
  • leon@leon-ai

    🧠 Leon आपका ओपन-सोर्स पर्सनल असिस्टेंट है।

    17,476+1पिछले 7 दिनों में स्टार का बदलाव
  • VoiceStudio@debpalash

    VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।

    14,835+2,880पिछले 7 दिनों में स्टार का बदलाव
  • sherpa-onnx@k2-fsa

    बिना इंटरनेट कनेक्शन के onnxruntime के साथ नेक्स्ट-जेन Kaldi का उपयोग करके स्पीच-टू-टेक्स्ट, टेक्स्ट-टू-स्पीच, स्पीकर डायराइजेशन, स्पीच एन्हांसमेंट, सोर्स सेपरेशन और VAD। एम्बेडेड सिस्टम, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 सर्वर, वेबसॉकेट सर्वर/क्लाइंट और 12 प्रोग्रामिंग भाषाओं का समर्थन करता है।

    14,575+95पिछले 7 दिनों में स्टार का बदलाव
  • supertonic@supertone-inc

    बिजली की गति वाला, ऑन-डिवाइस, बहुभाषी TTS — जो ONNX के माध्यम से नेटिव रूप से चलता है।

    13,757+20पिछले 7 दिनों में स्टार का बदलाव
  • voice-pro@abus-aikorea

    क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।

    12,730+54पिछले 7 दिनों में स्टार का बदलाव
  • edge-tts@rany2

    Microsoft Edge या Windows या API की की आवश्यकता के बिना Python से Microsoft Edge की ऑनलाइन टेक्स्ट-टू-स्पीच सेवा का उपयोग करें।

    11,847+29पिछले 7 दिनों में स्टार का बदलाव
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) ऑडियो, म्यूजिक और स्पीच जनरेशन के लिए एक टूलकिट है। इसका उद्देश्य पुनरुत्पादनीय अनुसंधान (reproducible research) का समर्थन करना और नए शोधकर्ताओं व इंजीनियरों को ऑडियो, म्यूजिक और स्पीच जनरेशन के क्षेत्र में शुरुआत करने में मदद करना है।

    10,276+1पिछले 7 दिनों में स्टार का बदलाव
  • espnet@espnet

    एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट

    9,949+3पिछले 7 दिनों में स्टार का बदलाव
  • EmotiVoice@netease-youdao

    EmotiVoice 😊: एक बहु-आवाज़ और प्रॉम्प्ट-नियंत्रित TTS इंजन

    8,522-1पिछले 7 दिनों में स्टार का बदलाव
  • mlx-audio@Blaizzy

    Apple के MLX फ्रेमवर्क पर बनी एक टेक्स्ट-टू-स्पीच (TTS), स्पीच-टू-टेक्स्ट (STT) और स्पीच-टू-स्पीच (STS) लाइब्रेरी, जो Apple Silicon पर कुशल भाषण विश्लेषण प्रदान करती है।

    7,826+23पिछले 7 दिनों में स्टार का बदलाव
  • MeloTTS@myshell-ai

    MyShell.ai द्वारा उच्च-गुणवत्ता वाली बहुभाषी टेक्स्ट-टू-स्पीच लाइब्रेरी। अंग्रेजी, स्पेनिश, फ्रेंच, चीनी, जापानी और कोरियाई का समर्थन करती है।

    7,616+7पिछले 7 दिनों में स्टार का बदलाव
  • espeak-ng@espeak-ng

    eSpeak NG एक ओपन सोर्स स्पीच सिंथेसाइज़र है जो सौ से अधिक भाषाओं और लहजों का समर्थन करता है।

    6,802+13पिछले 7 दिनों में स्टार का बदलाव
  • argmax-oss-swift@argmaxinc

    Apple Silicon के लिए ऑन-डिवाइस स्पीच AI

    6,353+8पिछले 7 दिनों में स्टार का बदलाव
  • StyleTTS2@yl4579

    StyleTTS 2: लार्ज स्पीच लैंग्वेज मॉडल के साथ स्टाइल डिफ़्यूज़न और एडवरसरियल ट्रेनिंग के माध्यम से मानव-स्तरीय टेक्स्ट-टू-स्पीच की ओर

    6,342+3पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-Prompt-Engineering@promptslab

    इस रिपॉजिटरी में Generative Pre-trained Transformer (GPT), ChatGPT, PaLM आदि पर ध्यान केंद्रित करते हुए Prompt Engineering के लिए चुनिंदा संसाधन शामिल हैं

    6,306+7पिछले 7 दिनों में स्टार का बदलाव
  • silero-models@snakers4

    Silero मॉडल: प्री-ट्रेनिंग टेक्स्ट-टू-स्पीच मॉडल जिन्हें अत्यंत सरल बनाया गया है

    6,084-1पिछले 7 दिनों में स्टार का बदलाव
  • ODS@Osmantic

    अपने PC, Mac, या Linux बॉक्स को AI सर्वर में बदलें। LLM इन्फेंस, चैट UI, वॉयस, एजेंट, वर्कफ़्लो, RAG, और इमेज जनरेशन।

    5,931+1,108पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस