tts
Repositorios de código abierto monitorizados etiquetados con tts, ordenados por estrellas.
- #121
Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.
★ 996+17Variación de estrellas de los últimos 7 días - #122
🧸 Lobe Vidol: haciendo que los ídolos virtuales sean accesibles para todos
★ 986+1Variación de estrellas de los últimos 7 días - #123
Un potente modelo de edición de audio basado en aprendizaje por refuerzo y LLM de 3B de parámetros, excelente para editar emociones, estilos de habla y paralingüística, con capacidades robustas de texto a voz zero-shot.
★ 971+1Variación de estrellas de los últimos 7 días - #124★ 970+2Variación de estrellas de los últimos 7 días
- #125★ 955-1Variación de estrellas de los últimos 7 días
- #126
Centro de investigación de IA de audio: artículos, modelos abiertos, puntos de referencia y conjuntos de datos sobre LLMs de audio, reconocimiento de voz, TTS, música y generación de audio.
★ 953+3Variación de estrellas de los últimos 7 días - #127
Hacer que las voces naturales de Azure TTS sean accesibles para cualquier aplicación compatible con SAPI 5.
★ 933+12Variación de estrellas de los últimos 7 días - #128
Un sistema TTS fundamental potenciado por LLM de código abierto
★ 920+1Variación de estrellas de los últimos 7 días - #129
Caja de herramientas de algoritmos de IA offline gratuita para Java, que admite reconocimiento facial, detección de vida, reconocimiento de expresiones, detección de objetos, segmentación de instancias, detección de peatones, OCR, reconocimiento de matrículas, reconocimiento de tablas, ASR+TTS, traducción automática y más. Se utiliza mediante Maven. Compatible con PyTorch y Tensorflow, e integra modelos como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) y Whisper.
★ 908+3Variación de estrellas de los últimos 7 días - #130
Un framework de alto rendimiento para servir modelos de ML, que ofrece procesamiento por lotes dinámico y pipelines de CPU/GPU para aprovechar al máximo su equipo de cómputo
★ 902+0Variación de estrellas de los últimos 7 días - #131
Interfaz web para usar XTTS y realizar su ajuste fino.
★ 895+0Variación de estrellas de los últimos 7 días - #132
DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.
★ 885+0Variación de estrellas de los últimos 7 días - #133
Transforma archivos PDF en podcasts de IA para obtener contenido de audio atractivo sobre la marcha.
★ 875+1Variación de estrellas de los últimos 7 días - #134
Un kit de herramientas fácil de usar para reconocimiento, transcripción y conversión de voz, entre otros
★ 873+0Variación de estrellas de los últimos 7 días - #135★ 867+1Variación de estrellas de los últimos 7 días
- #136
La solución de integración de IA más sencilla y de menor costo. Si te gusta este proyecto, por favor dale una estrella~
★ 856+2Variación de estrellas de los últimos 7 días - #137
SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.
★ 828+15Variación de estrellas de los últimos 7 días - #138
Voxtral ASR & TTS ejecutándose de forma nativa y en el navegador. Una implementación en Rust del ASR/TTS en tiempo real de Mistral Voxtral mini utilizando el framework Burn ML.
★ 819+2Variación de estrellas de los últimos 7 días - #139
Kokoro en Rust. https://huggingface.co/hexgrad/Kokoro-82M. TTS increíblemente rápido y en tiempo real con la mayor calidad disponible.
★ 817+1Variación de estrellas de los últimos 7 días - #140
Convierte cualquier repositorio de git en un podcast atractivo.
★ 814-1Variación de estrellas de los últimos 7 días - #141
Lector de libros electrónicos para terminal con conversión de texto a voz de calidad audiolibro. Soporta EPUB, PDF, DOCX, HTML, RTF, TXT y MD.
★ 806+2Variación de estrellas de los últimos 7 días - #142
🎤 Lobe TTS - Una biblioteca de TTS/STT confiable y de alta calidad para servidor y navegador
★ 805+1Variación de estrellas de los últimos 7 días - #143
Conversión de voz a texto y de texto a voz. Envía texto como mensajes OSC a VRChat para mostrarlo en el avatar.
★ 803+4Variación de estrellas de los últimos 7 días - #144
VTuber con IA que utiliza LLM, ASR, TTS, OCR, CV y otras tecnologías para realizar transmisiones en vivo o jugar Minecraft contigo.
★ 803+5Variación de estrellas de los últimos 7 días - #145
Motor de texto a voz (TTS) ligero y offline para Android que permite la clonación de voz a nivel de sistema y una lectura de alta fidelidad.
★ 801+2Variación de estrellas de los últimos 7 días - #146
Confucius4-TTS: un motor de síntesis de voz (TTS) multilingüe y translingüe de disparo cero (zero-shot).
★ 794+10Variación de estrellas de los últimos 7 días - #147
Un SDK modular de Swift para procesamiento de audio con MLX en Apple Silicon.
★ 772+6Variación de estrellas de los últimos 7 días - #148
Herramienta de traducción de pantalla en tiempo real para Android sin necesidad de ROOT, ideal para juegos, novelas visuales y manga. Soporta OCR local y en la nube, LLM offline, múltiples servicios de traducción y síntesis de voz (TTS), con visualización directa sobre la pantalla.
★ 768+82Variación de estrellas de los últimos 7 días - #149★ 763+1Variación de estrellas de los últimos 7 días
- #150
Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.
★ 757+10Variación de estrellas de los últimos 7 días