text-to-speech
Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a text-to-speech en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con text-to-speech.
- #1
Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA
★ 2362 - #2
Motor de inferencia todo en uno escrito en C++ puro para modelos de audio, basado en ggml. Admite TTS, STT, VAD, conversión de voz, generación de música y más, con un rendimiento altamente optimizado y sin dependencias de Python.
★ 2214 - #3
Editor de video de código abierto y local-first donde los creadores y agentes de IA editan la misma línea de tiempo real.
★ 788 - #4
Herramienta de traducción de pantalla en tiempo real para Android sin necesidad de ROOT, ideal para juegos, novelas visuales y manga. Soporta OCR local y en la nube, LLM offline, múltiples servicios de traducción y síntesis de voz (TTS), con visualización directa sobre la pantalla.
★ 768 - #5
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541
- #1
Genera videos cortos en HD a partir de un tema o palabra clave con un flujo de trabajo de IA automatizado.
★ 119.977+1509Variación de estrellas de los últimos 7 días - #2
Interfaz de usuario local para ejecutar y entrenar LLMs y modelos de difusión, incluyendo Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX y más.
★ 75.515+337Variación de estrellas de los últimos 7 días - #3
¡1 minuto de datos de voz es suficiente para entrenar un buen modelo TTS! (clonación de voz con pocos ejemplos)
★ 61.476+138Variación de estrellas de los últimos 7 días - #4
El primer sistema de producción de video agéntico y de código abierto del mundo. 12 tuberías de producción, más de 100 herramientas, más de 700 habilidades de agentes y archivos de conocimiento de producción. Convierte tu asistente de código de IA en un estudio completo de producción de video.
★ 55.719+1707Variación de estrellas de los últimos 7 días - #5
🐸💬 - Un conjunto de herramientas de aprendizaje profundo para texto a voz (TTS), probado en combate en investigación y producción
★ 45.985+18Variación de estrellas de los últimos 7 días - #6★ 39.814+9Variación de estrellas de los últimos 7 días
- #7★ 37.419+61Variación de estrellas de los últimos 7 días
- #8
🚀 Clona una voz en 5 segundos para generar voz arbitraria en tiempo real
★ 36.912+0Variación de estrellas de los últimos 7 días - #9
VoxCPM2: TTS sin tokenizador para generación de voz multilingüe, diseño de voz creativo y clonación realista
★ 36.595+345Variación de estrellas de los últimos 7 días - #10★ 23.686+109Variación de estrellas de los últimos 7 días
- #11
Modelo de generación de voz grande multilingüe, que proporciona capacidad de pila completa para inferencia, entrenamiento y despliegue.
★ 23.426+359Variación de estrellas de los últimos 7 días - #12★ 19.387+2Variación de estrellas de los últimos 7 días
- #13
Traduce el video de un idioma a otro e incorpora doblaje y subtítulos.
★ 18.871+38Variación de estrellas de los últimos 7 días - #14★ 17.476+1Variación de estrellas de los últimos 7 días
- #15
VoiceStudio es la alternativa a ElevenLabs de código abierto y totalmente local: clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción y creación de audiolibros en 646 idiomas.
★ 14.835+2880Variación de estrellas de los últimos 7 días - #16
Conversión de voz a texto, de texto a voz, diarización de hablantes, mejora de voz, separación de fuentes y VAD utilizando la nueva generación de Kaldi con onnxruntime sin conexión a Internet. Soporta sistemas embebidos, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket y 12 lenguajes de programación.
★ 14.575+95Variación de estrellas de los últimos 7 días - #17
TTS multilingüe, ultrarrápido y en el dispositivo, ejecutándose de forma nativa mediante ONNX.
★ 13.757+20Variación de estrellas de los últimos 7 días - #18
Gradio WebUI para creadores y desarrolladores, con TTS clave (Edge-TTS, kokoro) y clonación de voz zero-shot (E2 & F5-TTS, CosyVoice), procesamiento de audio con Whisper, descarga de YouTube, aislamiento vocal con Demucs y traducción multilingüe.
★ 12.730+54Variación de estrellas de los últimos 7 días - #19
Utiliza el servicio de conversión de texto a voz en línea de Microsoft Edge desde Python SIN necesidad de Microsoft Edge, Windows ni una clave de API
★ 11.847+29Variación de estrellas de los últimos 7 días - #20
Amphion (/æmˈfaɪən/) es un conjunto de herramientas para la generación de audio, música y voz. Su propósito es respaldar la investigación reproducible y ayudar a los investigadores y desarrolladores junior a iniciarse en el campo de la investigación y el desarrollo de la generación de audio, música y voz.
★ 10.276+1Variación de estrellas de los últimos 7 días - #21★ 9949+3Variación de estrellas de los últimos 7 días
- #22
EmotiVoice 😊: Un motor TTS multi-voz y controlado por avisos
★ 8522-1Variación de estrellas de los últimos 7 días - #23
Una biblioteca de texto a voz (TTS), voz a texto (STT) y voz a voz (STS) construida sobre el framework MLX de Apple, que proporciona un análisis de voz eficiente en Apple Silicon.
★ 7826+23Variación de estrellas de los últimos 7 días - #24
Biblioteca de conversión de texto a voz multilingüe de alta calidad de MyShell.ai. Compatible con inglés, español, francés, chino, japonés y coreano.
★ 7616+7Variación de estrellas de los últimos 7 días - #25
eSpeak NG es un sintetizador de voz de código abierto que admite más de cien idiomas y acentos.
★ 6802+13Variación de estrellas de los últimos 7 días - #26
IA de voz en el dispositivo para Apple Silicon.
★ 6353+8Variación de estrellas de los últimos 7 días - #27
StyleTTS 2: Hacia la conversión de texto a voz a nivel humano mediante difusión de estilo y entrenamiento adversarial con grandes modelos de lenguaje de voz
★ 6342+3Variación de estrellas de los últimos 7 días - #28
Este repositorio contiene recursos seleccionados manualmente para la ingeniería de prompts, con un enfoque en Generative Pre-trained Transformer (GPT), ChatGPT, PaLM, etc.
★ 6306+7Variación de estrellas de los últimos 7 días - #29
Silero Models: modelos de texto a voz preentrenados hechos extremadamente sencillos
★ 6084-1Variación de estrellas de los últimos 7 días - #30
Convierte tu PC, Mac o equipo Linux en un servidor de IA. Inferencia de LLM, interfaz de chat, voz, agentes, flujos de trabajo, RAG y generación de imágenes.
★ 5931+1108Variación de estrellas de los últimos 7 días