text-to-speech
Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.
- #91
Una integración de nodos personalizados para ComfyUI que permite el uso local de motores de conversión de texto a voz y voz a voz en múltiples idiomas. Soporta: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (clásico y multilingüe), F5-TTS, Higgs Audio 2, 3 y VibeVoice, con longitud de texto ilimitada, temporización SRT, soporte de personajes y diversas herramientas de audio.
★ 1187+0Variación de estrellas de los últimos 7 días - #92
Laboratorio práctico para construir, probar y evaluar aplicaciones con el framework de modelos fundacionales de Apple.
★ 1178+0Variación de estrellas de los últimos 7 días - #93★ 1173+0Variación de estrellas de los últimos 7 días
- #94
Kit de herramientas de voz con IA para Apple Silicon: ASR, TTS, voz a voz, VAD y diarización impulsados por MLX y CoreML
★ 1161+0Variación de estrellas de los últimos 7 días - #95
El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.
★ 1132+0Variación de estrellas de los últimos 7 días - #96
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+56Variación de estrellas de los últimos 7 días - #97
Estudio de IA local sin censura para Windows, Linux y macOS. Interfaz gráfica sin configuración para generación de imágenes, LLMs GGUF, conversión de texto a voz y de voz a texto.
★ 1118+13Variación de estrellas de los últimos 7 días - #98
SDK de voz con IA de código abierto. La alternativa a Vapi/Retell para desarrolladores que desean ser dueños de su stack. Asigna un número de teléfono a tu agente de IA en 4 líneas: Python y TypeScript, bajo licencia MIT, compatible con Twilio, Telnyx y Plivo.
★ 1051+7Variación de estrellas de los últimos 7 días - #99
Código de ejemplo de la API de Text-to-Speech de Microsoft en varios lenguajes, parte de Cognitive Services.
★ 1014+1Variación de estrellas de los últimos 7 días - #100
Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.
★ 1000+10Variación de estrellas de los últimos 7 días - #101
Un potente modelo de edición de audio basado en aprendizaje por refuerzo y LLM de 3B de parámetros, excelente para editar emociones, estilos de habla y paralingüística, con capacidades robustas de texto a voz zero-shot.
★ 973+1Variación de estrellas de los últimos 7 días - #102★ 972+4Variación de estrellas de los últimos 7 días
- #103
Procesamiento de voz Botium
★ 943+0Variación de estrellas de los últimos 7 días - #104
Hacer que las voces naturales de Azure TTS sean accesibles para cualquier aplicación compatible con SAPI 5.
★ 934+7Variación de estrellas de los últimos 7 días - #105
Cliente de la API REST de Vonage para PHP. Soporte para SMS, voz, texto a voz, números, verificación (2FA) y más.
★ 931-1Variación de estrellas de los últimos 7 días - #106
Un sistema TTS fundamental potenciado por LLM de código abierto
★ 919-1Variación de estrellas de los últimos 7 días - #107
Registro de capitán y mapa estelar 3D para Elite Dangerous.
★ 900+4Variación de estrellas de los últimos 7 días - #108
DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.
★ 884-1Variación de estrellas de los últimos 7 días - #109★ 868+2Variación de estrellas de los últimos 7 días
- #110
Lector de libros electrónicos para terminal con conversión de texto a voz de calidad audiolibro. Soporta EPUB, PDF, DOCX, HTML, RTF, TXT y MD.
★ 805+1Variación de estrellas de los últimos 7 días - #111
🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador
★ 805-1Variación de estrellas de los últimos 7 días - #112
Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.
★ 804+5Variación de estrellas de los últimos 7 días - #113
Motor de texto a voz (TTS) ligero y offline para Android que permite la clonación de voz a nivel de sistema y una lectura de alta fidelidad.
★ 804+5Variación de estrellas de los últimos 7 días - #114
Editor de video de código abierto y local-first donde los creadores y agentes de IA editan la misma línea de tiempo real.
★ 798+82Variación de estrellas de los últimos 7 días - #115
Confucius4-TTS: un motor de síntesis de voz (TTS) multilingüe y translingüe de disparo cero (zero-shot).
★ 794+6Variación de estrellas de los últimos 7 días - #116
Herramienta de traducción de pantalla en tiempo real para Android sin necesidad de ROOT, ideal para juegos, novelas visuales y manga. Soporta OCR local y en la nube, LLM offline, múltiples servicios de traducción y síntesis de voz (TTS), con visualización directa sobre la pantalla.
★ 794+73Variación de estrellas de los últimos 7 días - #117
Chatbot de voz local para conversaciones atractivas, impulsado por Ollama, Hugging Face Transformers y Coqui TTS Toolkit
★ 788+1Variación de estrellas de los últimos 7 días - #118
Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.
★ 774+5Variación de estrellas de los últimos 7 días - #119
Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.
★ 759+7Variación de estrellas de los últimos 7 días - #120
Sistema de comunicación aumentativa y alternativa (AAC) con conversión de texto a voz para el navegador.
★ 756+9Variación de estrellas de los últimos 7 días