text-to-speech
Repositorios de código abierto monitorizados etiquetados con text-to-speech, ordenados por estrellas.
- #61★ 1836+0Variación de estrellas de los últimos 7 días
- #62
El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android
★ 1807+0Variación de estrellas de los últimos 7 días - #63★ 1760+0Variación de estrellas de los últimos 7 días
- #64
El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.
★ 1756+0Variación de estrellas de los últimos 7 días - #65
Traduce automáticamente el texto de un video según un archivo de subtítulos y luego utiliza servicios de voz con IA para crear una nueva pista de audio doblada y traducida con el habla sincronizada utilizando los tiempos de los subtítulos.
★ 1746+0Variación de estrellas de los últimos 7 días - #66
Una excelente extensión de navegador que lee en voz alta el contenido de las páginas web con un solo clic
★ 1737+0Variación de estrellas de los últimos 7 días - #67
Forma declarativa de ejecutar modelos de IA en React Native en el dispositivo, impulsada por ExecuTorch.
★ 1707+0Variación de estrellas de los últimos 7 días - #68
El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.
★ 1649+0Variación de estrellas de los últimos 7 días - #69
Implementación no oficial de Parallel WaveGAN (+ MelGAN, Multi-band MelGAN, HiFi-GAN y StyleMelGAN) con Pytorch
★ 1646+0Variación de estrellas de los últimos 7 días - #70
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1622+0Variación de estrellas de los últimos 7 días - #71
Tema → Video narrado en 4K para agentes de codificación. v4.0: todo el TTS a través del componente del motor ttsCN (11 plataformas incluyendo clonación de voz MiniMax, sincronización nativa de subtítulos a nivel de palabra), motor de activos basado en manifiestos, composición Remotion, generación de IA con control de costos.
★ 1599+0Variación de estrellas de los últimos 7 días - #72
Servidor oficial del Protocolo de Contexto de Modelo (MCP) de MiniMax que permite la interacción con potentes API de texto a voz, generación de imágenes y generación de video.
★ 1573+0Variación de estrellas de los últimos 7 días - #73
Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.
★ 1557+0Variación de estrellas de los últimos 7 días - #74
Una integración completa de ComfyUI para el modelo de texto a voz VibeVoice de Microsoft, que permite la síntesis de voz de alta calidad para uno o varios hablantes directamente dentro de tus flujos de trabajo de ComfyUI.
★ 1555+0Variación de estrellas de los últimos 7 días - #75★ 1548+0Variación de estrellas de los últimos 7 días
- #76
Habla con tu Mac, consulta tus documentos, sin necesidad de la nube. IA de voz en el dispositivo + RAG.
★ 1542+0Variación de estrellas de los últimos 7 días - #77
Talking Head (3D): Una clase de JavaScript para sincronización de labios en tiempo real usando avatares 3D de cuerpo completo.
★ 1522+0Variación de estrellas de los últimos 7 días - #78
Una aplicación de Python/Pytorch para sintetizar voces humanas fácilmente
★ 1440+0Variación de estrellas de los últimos 7 días - #79★ 1437+0Variación de estrellas de los últimos 7 días
- #80
Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.
★ 1427+0Variación de estrellas de los últimos 7 días - #81
Speech-AI-Forge es un proyecto desarrollado en torno a un modelo de generación TTS, que implementa un servidor API y una interfaz web basada en Gradio.
★ 1418+0Variación de estrellas de los últimos 7 días - #82
Traducción sincronizada para videos. Doblaje de video
★ 1413+0Variación de estrellas de los últimos 7 días - #83
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #84
Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.
★ 1398+0Variación de estrellas de los últimos 7 días - #85
[ICASSP 2024] 🍵 Matcha-TTS: Una arquitectura de TTS rápida con conditional flow matching.
★ 1353+0Variación de estrellas de los últimos 7 días - #86
[ICLR 2025] Modelos de códec acústico discreto SOTA con 40/75 tokens por segundo para modelado de lenguaje de audio
★ 1317+0Variación de estrellas de los últimos 7 días - #87
Motor de inferencia offline para arte, conversaciones de voz en tiempo real, chatbots impulsados por LLM y flujos de trabajo automatizados
★ 1314+0Variación de estrellas de los últimos 7 días - #88
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #89
Interfaz web para diversas redes neuronales relacionadas con audio.
★ 1246+0Variación de estrellas de los últimos 7 días - #90
Modelo de texto a voz basado en Flow Matching con control de estilo mediante emojis.
★ 1228+0Variación de estrellas de los últimos 7 días