audio-language-model
Repositorios de código abierto monitorizados etiquetados con audio-language-model, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a audio-language-model en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con audio-language-model.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Familia de modelos ASR de código abierto basados en LLM para chino, dialectos, acentos y voz multilingüe, con motores de ejecución como FunASR, vLLM, streaming y llama.cpp.
★ 1512+10Variación de estrellas de los últimos 7 días - #2
Presentamos el conjunto de datos Audio Logical Reasoning (ALR), que consta de 6,446 muestras anotadas de texto-audio diseñadas específicamente para tareas de razonamiento complejo. Basándonos en este recurso, proponemos SoundMind, un algoritmo de aprendizaje por refuerzo (RL) basado en reglas diseñado para dotar a los modelos de lenguaje de audio (ALM) de capacidades de razonamiento bimodal profundo.
★ 1113+0Variación de estrellas de los últimos 7 días - #3
OmniVinci es un LLM omnimodal para la comprensión conjunta de visión, audio y lenguaje.
★ 677+0Variación de estrellas de los últimos 7 días - #4
El primer modelo de diálogo hablado de extremo a extremo en tiempo real de código abierto con clonación de voz personalizada.
★ 549-1Variación de estrellas de los últimos 7 días