text-to-speech
Erfasste Open-Source-Repos mit dem Tag text-to-speech, sortiert nach Sternen.
- #31★ 5.831+0Sterne-Änderung der letzten 7 Tage
- #32
Open-Source-Sprach-KI-Plattform. Self-Hosted-Alternative zu Vapi und Retell. On-Premise, BYOK für Speech-to-Speech oder LLM/STT/TTS, mit visuellem Workflow-Builder, MCP-nativ und Telefonie-Unterstützung.
★ 5.568+0Sterne-Änderung der letzten 7 Tage - #33
Open-Source-KI-Tool zur Videolokalisierung: automatischer Download von YouTube/Bilibili-Videos, Untertitelung und Übersetzung, Stimmklon-Synchronisation, Audiospur-Mischung und Untertitel-Einbettung.
★ 5.404+0Sterne-Änderung der letzten 7 Tage - #34
Dockerisierter OpenAI-kompatibler Wrapper für Kokoro-82M Text-to-Speech mit Unterstützung für Multiplatform-CPU, AMD- und NVIDIA-GPU PyTorch; mehrere Sprecher, Sprachmischung, automatisches Zusammenfügen, Caption-Zeitstempel, SSML und Readalong-Web-UI
★ 5.399+0Sterne-Änderung der letzten 7 Tage - #35
:DiffSinger: Gesangssynthese über flachen Diffusionsmechanismus (SVS & TTS); AAAI 2022; Offizieller Code
★ 4.855+0Sterne-Änderung der letzten 7 Tage - #36★ 4.624+0Sterne-Änderung der letzten 7 Tage
- #37
Eine Fast-Echtzeit-Implementierung von OpenAI Whisper.
★ 4.246+0Sterne-Änderung der letzten 7 Tage - #38
Grundlegendes Modell für menschenähnliches, expressives TTS
★ 4.203+0Sterne-Änderung der letzten 7 Tage - #39
Die MOSS‑TTS-Familie ist eine Open-Source-Modellfamilie zur Sprach- und Klangerzeugung von MOSI.AI und dem OpenMOSS-Team. Sie wurde für Szenarien in der realen Welt mit hoher Wiedergabetreue, starkem Ausdruck und hoher Komplexität entwickelt und deckt stabile Langform-Sprache, Dialoge mit mehreren Sprechern, Sprach-/Charakterdesign, Umgebungs-Soundeffekte und Echtzeit-Streaming-TTS ab.
★ 4.058+0Sterne-Änderung der letzten 7 Tage - #40
Konvertiert Text in Echtzeit in Sprache.
★ 4.021+0Sterne-Änderung der letzten 7 Tage - #41
TensorFlowTTS: Echtzeit-Sprachsynthese auf dem neuesten Stand der Technik für TensorFlow 2 (unterstützt Englisch, Französisch, Koreanisch, Chinesisch, Deutsch und ist einfach für andere Sprachen anzupassen)
★ 3.996+0Sterne-Änderung der letzten 7 Tage - #42
Ein einfaches, hochwertiges Sprachkonvertierungstool mit Fokus auf Benutzerfreundlichkeit und Leistung.
★ 3.674+0Sterne-Änderung der letzten 7 Tage - #43
Eine einzige Gradio + React WebUI mit Erweiterungen für ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T und Bark!
★ 3.250+0Sterne-Änderung der letzten 7 Tage - #44
Das offizielle Python SDK für die ElevenLabs API.
★ 3.083+0Sterne-Änderung der letzten 7 Tage - #45
[AutoArk] GPA (General Purpose Audio) kann ASR, TTS und Sprachkonvertierung mit einem einzigen kleinen Modell durchführen!
★ 3.061+0Sterne-Änderung der letzten 7 Tage - #46
aeneas ist eine Python/C-Bibliothek und eine Reihe von Werkzeugen zur automatischen Synchronisierung von Audio und Text (sogenanntes Forced Alignment)
★ 2.862+0Sterne-Änderung der letzten 7 Tage - #47★ 2.818+0Sterne-Änderung der letzten 7 Tage
- #48
Python-Bibliothek und CLI-Tool zur Schnittstellenanbindung an die Text-to-Speech-API von Google Translate
★ 2.628+0Sterne-Änderung der letzten 7 Tage - #49
🚀 Ein-Klick-Bereitstellung (inklusive Offline-Integrationspaket)! Basierend auf ChatTTS, unterstützt Streaming-Ausgabe, Timbre-Gacha, Generierung langer Audiodateien und Vorlesen mit verteilten Rollen. Einfach zu bedienen, keine komplexe Installation erforderlich.
★ 2.593+0Sterne-Änderung der letzten 7 Tage - #50
MARY TTS – Ein in reinem Java geschriebenes, Open-Source-basiertes und mehrsprachiges Text-to-Speech-Synthesesystem
★ 2.583+0Sterne-Änderung der letzten 7 Tage - #51★ 2.530+0Sterne-Änderung der letzten 7 Tage
- #52
Vietnamesisches TTS mit sofortigem Voice Cloning • On-Device • Echtzeit-CPU-Inferenz • 24kHz Audioqualität • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt
★ 2.468+0Sterne-Änderung der letzten 7 Tage - #53
Eine Echtzeit-Sprachlaufzeitumgebung für KI-Agenten, die sie im Gespräch und aktiv hält.
★ 2.379+58Sterne-Änderung der letzten 7 Tage - #54
HiFi-GAN: Generative Adversarial Networks für effiziente und hochpräzise Sprachsynthese
★ 2.367+0Sterne-Änderung der letzten 7 Tage - #55
PyTorch-Implementierung von VALL-E (Zero-Shot Text-to-Speech), reproduzierte Demo https://lifeiteng.github.io/valle/index.html
★ 2.215+0Sterne-Änderung der letzten 7 Tage - #56
Eine All-in-One-Inferenz-Engine in reinem C++ für Audiomodelle, angetrieben von ggml. Unterstützt TTS, STT, VAD, Sprachkonvertierung, Musikgenerierung und mehr bei hochoptimierter Leistung. Keine Python-Abhängigkeit.
★ 2.214+0Sterne-Änderung der letzten 7 Tage - #57
Steuerbare und schnelle Text-to-Speech-Technologie für über 7000 Sprachen!
★ 2.207+0Sterne-Änderung der letzten 7 Tage - #58
Kostenloser, hochwertiger Text-to-Speech-API-Endpunkt als Ersatz für OpenAI, Azure oder ElevenLabs
★ 2.075+0Sterne-Änderung der letzten 7 Tage - #59★ 2.048+0Sterne-Änderung der letzten 7 Tage
- #60
AI-natives VideoProduktions-Toolkit für Claude Code
★ 2.036+0Sterne-Änderung der letzten 7 Tage