speech-synthesis
Repositorios de código abierto monitorizados etiquetados con speech-synthesis, ordenados por estrellas.
- #31
Una aplicación de ChatGPT de código abierto con voz
★ 2350-1Variación de estrellas de los últimos 7 días - #32
¡Texto a voz controlable y rápido para más de 7000 idiomas!
★ 2207-1Variación de estrellas de los últimos 7 días - #33★ 1836+1Variación de estrellas de los últimos 7 días
- #34
Implementación no oficial de Parallel WaveGAN (+ MelGAN, Multi-band MelGAN, HiFi-GAN y StyleMelGAN) con Pytorch
★ 1646+1Variación de estrellas de los últimos 7 días - #35
Aplicación de notas para Linux. Permite tomar notas, leer y traducir con funciones offline de voz a texto, texto a voz y traducción automática.
★ 1622+8Variación de estrellas de los últimos 7 días - #36
Nodos personalizados que amplían las capacidades de Comfyui
★ 1525+1Variación de estrellas de los últimos 7 días - #37★ 1498+0Variación de estrellas de los últimos 7 días
- #38
Preentrenamiento de voz-texto modal unificado para procesamiento de lenguaje hablado
★ 1449+0Variación de estrellas de los últimos 7 días - #39
Aloja localmente el potente modelo de TTS Chatterbox. Este servidor ofrece una interfaz web intuitiva, endpoints de API flexibles (compatibles con OpenAI), voces predefinidas, clonación de voz y procesamiento de texto a gran escala para audiolibros. Se ejecuta con aceleración en NVIDIA (CUDA), AMD (ROCm) y CPU.
★ 1427+1Variación de estrellas de los últimos 7 días - #40
Una lista de corpus de voz accesibles para ASR, TTS y otras tecnologías de voz.
★ 1399+0Variación de estrellas de los últimos 7 días - #41
Restauración general de voz.
★ 1375+0Variación de estrellas de los últimos 7 días - #42★ 1339+0Variación de estrellas de los últimos 7 días
- #43
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #44
Modelo de texto a voz basado en Flow Matching con control de estilo mediante emojis.
★ 1228+4Variación de estrellas de los últimos 7 días - #45★ 1227+1Variación de estrellas de los últimos 7 días
- #46
Irina: un asistente de voz en ruso para trabajar sin conexión. Admite habilidades mediante complementos.
★ 1153+0Variación de estrellas de los últimos 7 días - #47
VTuber con IA para streaming en YouTube/Twitch.
★ 1116+2Variación de estrellas de los últimos 7 días - #48
AutoVC: Transferencia de estilo de voz Zero-Shot solo con pérdida de autoencoder
★ 1100+0Variación de estrellas de los últimos 7 días - #49
YourTTS: hacia un TTS multihablante Zero-Shot y conversión de voz Zero-Shot para todos.
★ 1054+0Variación de estrellas de los últimos 7 días - #50
Código de ejemplo de la API de Text-to-Speech de Microsoft en varios lenguajes, parte de Cognitive Services.
★ 1014+3Variación de estrellas de los últimos 7 días - #51
Generador de audiolibros multivoz impulsado por IA: anotación de guiones con LLM, clonación de voz, diseño de voz, entrenamiento LoRA, control de estilo por línea y exportación a MP3, M4B con capítulos o multipista de Audacity. Construido sobre Qwen3-TTS.
★ 1000+20Variación de estrellas de los últimos 7 días - #52★ 972+3Variación de estrellas de los últimos 7 días
- #53
Hacer que las voces naturales de Azure TTS sean accesibles para cualquier aplicación compatible con SAPI 5.
★ 934+13Variación de estrellas de los últimos 7 días - #54
Un sistema TTS fundamental potenciado por LLM de código abierto
★ 919+1Variación de estrellas de los últimos 7 días - #55
Un LLM conversacional que se ejecuta en su propia computadora sin necesidad de internet.
★ 891+2Variación de estrellas de los últimos 7 días - #56
DiffWave es un vocoder neuronal y sintetizador de formas de onda rápido y de alta calidad.
★ 884+0Variación de estrellas de los últimos 7 días - #57
Confucius4-TTS: un motor de síntesis de voz (TTS) multilingüe y translingüe de disparo cero (zero-shot).
★ 794+10Variación de estrellas de los últimos 7 días - #58
Asistente de voz en tiempo real: streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatible con la API Realtime de OpenAI. Clonación de voz, interrupción (barge-in), ~9x tiempo real en una 4090. Licencia Apache 2.0.
★ 759+10Variación de estrellas de los últimos 7 días - #59
Thorsten-Voice: Una voz TTS en alemán de alta calidad, gratuita y sin conexión, diseñada para utilizarse en cualquier proyecto sin complicaciones de licencia.
★ 729+1Variación de estrellas de los últimos 7 días - #60
Artículos de INTERSPEECH 2023-2024: Una colección completa de artículos de investigación influyentes y destacados de la conferencia INTERSPEECH 2023-24. Explora los últimos avances en procesamiento de voz y lenguaje. Incluye código.
★ 684+0Variación de estrellas de los últimos 7 días