text-to-audio
Repositorios de código abierto monitorizados etiquetados con text-to-audio, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a text-to-audio en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con text-to-audio.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Amphion (/æmˈfaɪən/) es un conjunto de herramientas para la generación de audio, música y voz. Su propósito es respaldar la investigación reproducible y ayudar a los investigadores y desarrolladores junior a iniciarse en el campo de la investigación y el desarrollo de la generación de audio, música y voz.
★ 10.276+1Variación de estrellas de los últimos 7 días - #2★ 5831+45Variación de estrellas de los últimos 7 días
- #3
[CVPR 2025] MMAudio: Dominando el entrenamiento conjunto multimodal para la síntesis de video a audio de alta calidad
★ 2264+0Variación de estrellas de los últimos 7 días - #4
[NeurIPS 2025] Implementación en PyTorch de [ThinkSound], un framework unificado para generar audio desde cualquier modalidad, guiado por razonamiento de cadena de pensamiento (CoT).
★ 1378+0Variación de estrellas de los últimos 7 días - #5
StreamSpeech es un modelo integrado "Todo en uno" para el reconocimiento, traducción y síntesis de voz tanto fuera de línea como simultáneos.
★ 1288+0Variación de estrellas de los últimos 7 días - #6
Interfaz web para diversas redes neuronales relacionadas con audio.
★ 1246+0Variación de estrellas de los últimos 7 días - #7★ 1238-1Variación de estrellas de los últimos 7 días
- #8
HunyuanVideo-Foley: Difusión multimodal con alineación de representación para la generación de audio Foley de alta fidelidad.
★ 1056+4Variación de estrellas de los últimos 7 días - #9
[ICLR 2026] TangoFlux: Generación de texto a audio superrápida y fiel con Flow Matching
★ 882+0Variación de estrellas de los últimos 7 días - #10
Implementación en PyTorch de Make-An-Audio (ICML'23) con un modelo generativo de texto a audio.
★ 668+0Variación de estrellas de los últimos 7 días - #11★ 631+1Variación de estrellas de los últimos 7 días
- #12
🔥🔥🔥 Una lista seleccionada de artículos sobre generación multimodal basada en LLMs (imagen, video, 3D y audio).
★ 552+0Variación de estrellas de los últimos 7 días - #13
Un proyecto de código abierto para unificar el procesamiento y la generación de audio.
★ 512+1Variación de estrellas de los últimos 7 días