audio-language-model
Erfasste Open-Source-Repos mit dem Tag audio-language-model, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit audio-language-model am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit audio-language-model getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Open-Source-LLM-basiertes ASR-Modellfamilie für Chinesisch, Dialekte, Akzente und mehrsprachige Sprache, mit FunASR, vLLM, Streaming- und llama.cpp-Runtimes.
★ 1.512+14Sterne-Änderung der letzten 7 Tage - #2
Wir stellen den Datensatz „Audio Logical Reasoning (ALR)“ vor, der aus 6.446 text-audio-annotierten Stichproben besteht, die speziell für komplexe Reasoning-Aufgaben entwickelt wurden. Basierend auf dieser Ressource schlagen wir SoundMind vor, einen regelbasierten Reinforcement-Learning-Algorithmus (RL), der Audiolanguage-Modelle (ALMs) mit tiefen bimodalen Reasoning-Fähigkeiten ausstattet.
★ 1.113+0Sterne-Änderung der letzten 7 Tage - #3
OmniVinci ist ein omnimodales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.
★ 677+1Sterne-Änderung der letzten 7 Tage - #4
Das weltweit erste Open-Source-Modell für Echtzeit-End-to-End-Sprachdialoge mit personalisiertem Voice-Cloning.
★ 549-1Sterne-Änderung der letzten 7 Tage