text-to-speech
Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.
- #31★ 5831+45Variación de estrellas de los últimos 7 días
- #32
Plataforma de voz de IA de código abierto. Alternativa autohospedada a Vapi y Retell. En local (On Prem), BYOK para conversión de voz a voz o LLM/STT/TTS, con un creador visual de flujos de trabajo, compatibilidad nativa con MCP y telefonía
★ 5568+45Variación de estrellas de los últimos 7 días - #33
Herramienta de localización de video con IA de código abierto: automatiza la descarga de videos de YouTube/Bilibili, reconocimiento y traducción de subtítulos, clonación de voz y doblaje, mezcla de pistas de audio y subtitulado integrado.
★ 5404+25Variación de estrellas de los últimos 7 días - #34
Contenedor Docker compatible con la API de OpenAI para el modelo de conversión de texto a voz Kokoro-82M con PyTorch multiplataforma para CPU, AMD y GPU NVIDIA; múltiples locutores, mezcla de voces, unión automática, marcas de tiempo en subtítulos, SSML y una interfaz web de lectura.
★ 5399+19Variación de estrellas de los últimos 7 días - #35
DiffSinger: Síntesis de voz cantada mediante mecanismo de difusión superficial (SVS y TTS); AAAI 2022; Código oficial
★ 4855+3Variación de estrellas de los últimos 7 días - #36★ 4624+0Variación de estrellas de los últimos 7 días
- #37
Una implementación casi en tiempo real de Whisper de OpenAI.
★ 4246+3Variación de estrellas de los últimos 7 días - #38
Modelo fundacional para TTS expresivo y de aspecto humano
★ 4203-1Variación de estrellas de los últimos 7 días - #39
MOSS‑TTS Family es una familia de modelos de código abierto para la generación de voz y sonido de MOSI.AI y el equipo OpenMOSS. Está diseñada para escenarios del mundo real complejos, de alta fidelidad y gran expresividad, que abarcan voz larga y estable, diálogo multilocutor, diseño de voz y personajes, efectos de sonido ambiental y TTS en streaming en tiempo real.
★ 4058+18Variación de estrellas de los últimos 7 días - #40
Convierte texto a voz en tiempo real
★ 4021+2Variación de estrellas de los últimos 7 días - #41
:stuck_out_tongue_closed_eyes: TensorFlowTTS: Síntesis de voz en tiempo real de vanguardia para TensorFlow 2 (compatible con inglés, francés, coreano, chino, alemán y fácil de adaptar a otros idiomas)
★ 3996+0Variación de estrellas de los últimos 7 días - #42
Una herramienta de conversión de voz simple y de alta calidad, enfocada en la facilidad de uso y el rendimiento.
★ 3674+14Variación de estrellas de los últimos 7 días - #43
Una WebUI única en Gradio + React con extensiones para ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T y Bark.
★ 3250+5Variación de estrellas de los últimos 7 días - #44
El SDK oficial de Python para la API de ElevenLabs.
★ 3083+2Variación de estrellas de los últimos 7 días - #45
[AutoArk] ¡GPA (Audio de Propósito General) puede hacer reconocimiento de voz (ASR), síntesis de voz (TTS) y conversión de voz con un modelo diminuto!
★ 3061+164Variación de estrellas de los últimos 7 días - #46
aeneas es una biblioteca de Python/C y un conjunto de herramientas para sincronizar automáticamente audio y texto (también conocido como alineación forzada)
★ 2862+0Variación de estrellas de los últimos 7 días - #47★ 2818+1Variación de estrellas de los últimos 7 días
- #48
Biblioteca de Python y herramienta de línea de comandos para interactuar con la API de conversión de texto a voz de Google Translate
★ 2628+0Variación de estrellas de los últimos 7 días - #49
🚀 Despliegue con un solo clic (incluye paquete sin conexión). Basado en ChatTTS, soporta salida en streaming, extracción de voces, generación de audio largo y lectura por roles. Fácil de usar, sin instalaciones complejas.
★ 2593+0Variación de estrellas de los últimos 7 días - #50
MARY TTS -- un sistema de síntesis de texto a voz multilingüe y de código abierto escrito en Java puro.
★ 2583+0Variación de estrellas de los últimos 7 días - #51★ 2530+0Variación de estrellas de los últimos 7 días
- #52
TTS en vietnamita con clonación de voz instantánea • En el dispositivo • Inferencia en CPU en tiempo real • Calidad de audio de 24 kHz • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt
★ 2468+21Variación de estrellas de los últimos 7 días - #53
HiFi-GAN: Redes Generativas Antagónicas para la síntesis de voz eficiente y de alta fidelidad
★ 2367+0Variación de estrellas de los últimos 7 días - #54
Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA
★ 2358+68Variación de estrellas de los últimos 7 días - #55
Implementación en PyTorch de VALL-E (Texto a voz de disparo cero), Demo reproducida https://lifeiteng.github.io/valle/index.html
★ 2215+0Variación de estrellas de los últimos 7 días - #56
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214+115Variación de estrellas de los últimos 7 días - #57
¡Texto a voz controlable y rápido para más de 7000 idiomas!
★ 2207-1Variación de estrellas de los últimos 7 días - #58
Endpoint de API de texto a voz gratuito y de alta calidad para reemplazar OpenAI, Azure o ElevenLabs
★ 2075+5Variación de estrellas de los últimos 7 días - #59
IA multimodal en tiempo real y en el dispositivo con funciones similares a GPT-Live
★ 2048+7Variación de estrellas de los últimos 7 días - #60
Toolkit de producción de video nativo de IA para Claude Code
★ 2036+15Variación de estrellas de los últimos 7 días