audio-language-model
Dépôts open source suivis étiquetés audio-language-model, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de audio-language-model sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés audio-language-model.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Famille de modèles ASR open-source basés sur LLM pour le chinois, les dialectes, les accents et la parole multilingue, avec runtimes FunASR, vLLM, streaming et llama.cpp.
★ 1 512+14Évolution des étoiles sur les 7 derniers jours - #2
Nous présentons le jeu de données Audio Logical Reasoning (ALR), composé de 6 446 échantillons texte-audio annotés, spécifiquement conçus pour des tâches de raisonnement complexe. En nous appuyant sur cette ressource, nous proposons SoundMind, un algorithme d'apprentissage par renforcement (RL) basé sur des règles, conçu pour doter les modèles de langage audio (ALM) de capacités de raisonnement bimodal approfondies.
★ 1 113+0Évolution des étoiles sur les 7 derniers jours - #3
OmniVinci est un LLM multimodal pour la compréhension conjointe de la vision, de l'audio et du langage.
★ 677+1Évolution des étoiles sur les 7 derniers jours - #4
Le premier modèle de dialogue parlé en temps réel de bout en bout open-source au monde avec clonage de voix personnalisé.
★ 549-1Évolution des étoiles sur les 7 derniers jours