QwenAudio
Repositorios de código abierto monitorizados de QwenAudio, ordenados por estrellas.
- #1
Modelo de generación de voz grande multilingüe, que proporciona capacidad de pila completa para inferencia, entrenamiento y despliegue.
★ 23.426+498Variación de estrellas de los últimos 7 días - #2
Modelo de código abierto SenseVoiceSmall para ASR en mandarín, cantonés, inglés, japonés y coreano, identificación de idiomas, reconocimiento de emociones y detección de eventos de audio.
★ 9209+53Variación de estrellas de los últimos 7 días - #3
Un tiempo de ejecución de voz en tiempo real que mantiene a los agentes hablando, trabajando y presentes. Tiempo de ejecución de voz en tiempo real para agentes de IA
★ 2345+54Variación de estrellas de los últimos 7 días - #4
Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.
★ 1512+14Variación de estrellas de los últimos 7 días - #5
[NeurIPS 2025] Implementación en PyTorch de [ThinkSound], un framework unificado para generar audio desde cualquier modalidad, guiado por razonamiento de cadena de pensamiento (CoT).
★ 1378+0Variación de estrellas de los últimos 7 días - #6
Fun-Audio-Chat es un modelo de lenguaje de audio a gran escala diseñado para interacciones de voz naturales y de baja latencia.
★ 1002+5Variación de estrellas de los últimos 7 días