मुख्य सामग्री पर जाएँ
buildradar
साइन इन करें
विषय · text-to-speech

text-to-speech

text-to-speech टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

150 रिपॉजिटरी
  • RHVoice@RHVoice

    रूसी और अन्य भाषाओं के लिए एक मुफ्त और ओपन सोर्स स्पीच सिंथेसाइज़र

    1,837+0पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Android के लिए Alan AI SDK

    1,807+0पिछले 7 दिनों में स्टार का बदलाव
  • Genie-TTS@High-Logic

    GPT-SoVITS ONNX इन्फेरेंस इंजन और मॉडल कन्वर्टर

    1,774+0पिछले 7 दिनों में स्टार का बदलाव
  • आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Flutter के लिए Alan AI SDK

    1,756+0पिछले 7 दिनों में स्टार का बदलाव
  • सबटाइटल फ़ाइल के आधार पर वीडियो के पाठ का स्वचालित रूप से अनुवाद करता है, और फिर उपशीर्षक के समय का उपयोग करके भाषण को सिंक्रनाइज़ किए जाने वाले एक नया डब और अनुवादित ऑडियो ट्रैक बनाने के लिए AI आवाज सेवाओं का उपयोग करता है।

    1,746+0पिछले 7 दिनों में स्टार का बदलाव
  • read-aloud@ken107

    एक बेहतरीन ब्राउज़र एक्सटेंशन जो एक क्लिक में वेबपेज सामग्री को बोलकर पढ़ता है।

    1,742+0पिछले 7 दिनों में स्टार का बदलाव
  • react-native-executorch@software-mansion

    ExecuTorch द्वारा संचालित, React Native में डिवाइस पर AI मॉडल चलाने का घोषणात्मक तरीका।

    1,730+0पिछले 7 दिनों में स्टार का बदलाव
  • alan-sdk-ionic@alan-ai

    आपके ऐप के लिए सेल्फ-कोडिंग सिस्टम — Ionic के लिए Alan AI SDK

    1,649+0पिछले 7 दिनों में स्टार का बदलाव
  • ParallelWaveGAN@kan-bayashi

    Pytorch के साथ अनौपचारिक Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN)।

    1,645+0पिछले 7 दिनों में स्टार का बदलाव
  • dsnote@mkiol

    Speech Note Linux ऐप। ऑफ़लाइन Speech to Text, Text to Speech और मशीन अनुवाद के साथ नोट्स लेना, पढ़ना और अनुवाद करना।

    1,633+0पिछले 7 दिनों में स्टार का बदलाव
  • video-podcast-maker@Agents365-ai

    विषय → कोडिंग एजेंटों के लिए 4K नैरेटेड वीडियो। v4.0: ttsCN इंजन घटक के माध्यम से सभी TTS (11 प्लेटफ़ॉर्म जिनमें MiniMax वॉयस क्लोन, मूल शब्द-स्तरीय उपशीर्षक सिंक शामिल हैं), मैनिफेस्ट-आधारित एसेट इंजन, Remotion कंपोज़िशन, लागत-नियंत्रित AI जनरेशन

    1,608+0पिछले 7 दिनों में स्टार का बदलाव
  • soprano@ekwek1

    Soprano: त्वरित, अति-यथार्थवादी टेक्स्ट-टू-स्पीच

    1,584+0पिछले 7 दिनों में स्टार का बदलाव
  • MiniMax-MCP@MiniMax-AI

    आधिकारिक MiniMax Model Context Protocol (MCP) सर्वर जो शक्तिशाली Text to Speech, इमेज जनरेशन और वीडियो जनरेशन API के साथ इंटरैक्शन सक्षम बनाता है।

    1,579+0पिछले 7 दिनों में स्टार का बदलाव
  • vllm-mlx@waybarrios

    Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।

    1,568+0पिछले 7 दिनों में स्टार का बदलाव
  • VibeVoice-ComfyUI@Enemyx-net

    Microsoft के VibeVoice टेक्स्ट-टू-स्पीच मॉडल के लिए एक व्यापक ComfyUI इंटीग्रेशन, जो सीधे आपके ComfyUI वर्कफ़्लो के भीतर उच्च-गुणवत्ता वाले सिंगल और मल्टी-स्पीकर वॉयस सिंथेसिस को सक्षम बनाता है।

    1,560+0पिछले 7 दिनों में स्टार का बदलाव
  • TalkingHead@met4citizen

    Talking Head (3D): फुल-बॉडी 3D अवतारों का उपयोग करके रीयल-टाइम लिप-सिंक के लिए एक JavaScript क्लास।

    1,544+0पिछले 7 दिनों में स्टार का बदलाव
  • शक्तिशाली Chatterbox TTS मॉडल को सेल्फ-हॉस्ट करें। यह सर्वर एक उपयोगकर्ता के अनुकूल Web UI, लचीले API एंडपॉइंट (OpenAI संगत सहित), पूर्वनिर्धारित आवाज़ें, वॉयस क्लोनिंग, और बड़े ऑडियोबुक-स्केल टेक्स्ट प्रोसेसिंग प्रदान करता है। NVIDIA (CUDA), AMD (ROCm), और CPU पर त्वरित रूप से चलता है।

    1,440+0पिछले 7 दिनों में स्टार का बदलाव
  • OuteTTS@edwko

    OuteTTS मॉडल के लिए इंटरफ़ेस।

    1,439+0पिछले 7 दिनों में स्टार का बदलाव
  • Voice-Cloning-App@voice-cloning-app

    मानव आवाज़ों को आसानी से सिंथेटिक रूप से उत्पन्न करने के लिए एक Python/Pytorch ऐप

    1,437+0पिछले 7 दिनों में स्टार का बदलाव
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge एक प्रोजेक्ट है जिसे TTS जनरेशन मॉडल के चारों ओर विकसित किया गया है, जो एक API सर्वर और Gradio-आधारित WebUI को लागू करता है।

    1,420+0पिछले 7 दिनों में स्टार का बदलाव
  • SoniTranslate@R3gm

    वीडियो के लिए सिंक्रोनाइज्ड ट्रांसलेशन। वीडियो डबिंग

    1,414+0पिछले 7 दिनों में स्टार का बदलाव
  • mlx-tune@ARahim3

    Apple Silicon वाले Mac पर LLM को फाइन-ट्यून करें। SFT, DPO, GRPO, Vision, TTS, STT, Embedding और OCR फाइन-ट्यूनिंग — MLX पर नेटिव रूप से। Unsloth-compatible API।

    1,404+0पिछले 7 दिनों में स्टार का बदलाव
  • 💎 ASR, TTS और अन्य Speech Technologies के लिए एक्सेसिबल स्पीच कॉर्पोरा की एक सूची

    1,402+0पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-TTSD@OpenMOSS

    MOSS-TTSD एक स्पोकन डायलॉग जनरेशन मॉडल है जिसे expressive multi-speaker synthesis के लिए डिज़ाइन किया गया है। इसमें long-context modeling, flexible speaker control और multilingual support शामिल है, साथ ही यह छोटे ऑडियो संदर्भों से zero-shot voice cloning को सक्षम बनाता है।

    1,394+0पिछले 7 दिनों में स्टार का बदलाव
  • Matcha-TTS@shivammehta25

    [ICASSP 2024] 🍵 Matcha-TTS: सशर्त प्रवाह मिलान (conditional flow matching) के साथ एक तेज़ TTS आर्किटेक्चर

    1,355+0पिछले 7 दिनों में स्टार का बदलाव
  • WavTokenizer@jishengpeng

    [ICLR 2025] ऑडियो लैंग्वेज मॉडलिंग के लिए 40/75 टोकन प्रति सेकंड के साथ SOTA डिस्क्रीट एकॉस्टिक कोडेक मॉडल

    1,319+0पिछले 7 दिनों में स्टार का बदलाव
  • airunner@Capsize-Games

    कला, वास्तविक समय की आवाज़ बातचीत, LLM-संचालित चैटबॉट्स और स्वचालित वर्कफ़्लो के लिए ऑफ़लाइन अनुमान इंजन

    1,314+0पिछले 7 दिनों में स्टार का बदलाव
  • StreamSpeech@ictnlp

    StreamSpeech ऑफ़लाइन और एक साथ स्पीच रिकग्निशन, स्पीच ट्रांसलेशन और स्पीच सिंथेसिस के लिए एक "ऑल इन वन" सीमलेस मॉडल है।

    1,289+0पिछले 7 दिनों में स्टार का बदलाव
  • Uncensored-Local-Studio@techjarves

    Windows, Linux और macOS के लिए अनसेंसर्ड लोकल AI स्टूडियो। इमेज जनरेशन, GGUF LLMs, टेक्स्ट-टू-स्पीच और स्पीच-टू-टेक्स्ट के लिए जीरो-सेटअप GUI।

    1,287+13पिछले 7 दिनों में स्टार का बदलाव
  • Irodori-TTS@Aratako

    इमोजी-संचालित स्टाइल नियंत्रण के साथ एक Flow Matching-आधारित Text-to-Speech मॉडल

    1,268+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस