multimodal-llm
Erfasste Open-Source-Repos mit dem Tag multimodal-llm, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit multimodal-llm am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit multimodal-llm getaggt wurden.
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.330 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
Open-Source-ASR-Modelle in Industriequalität, die Mandarin, chinesische Dialekte und Englisch unterstützen. Sie erreichen einen neuen SOTA-Standard auf öffentlichen Mandarin-ASR-Benchmarks und bieten zudem eine hervorragende Erkennung von Liedtexten.
★ 1.975+2Sterne-Änderung der letzten 7 Tage - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.330+426Sterne-Änderung der letzten 7 Tage - #3
Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.
★ 1.310+2Sterne-Änderung der letzten 7 Tage - #4
Offizielle Implementierung des Papers „MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens“
★ 869+0Sterne-Änderung der letzten 7 Tage - #5
Ein industrietaugliches All-in-One-ASR-System auf dem neuesten Stand der Technik mit ASR-, VAD-, LID- und Punc-Modulen. FireRedASR2 unterstützt Chinesisch (Mandarin, über 20 Dialekte/Akzente), Englisch, Code-Switching sowie Sprache- und Gesangs-ASR. FireRedVAD unterstützt Sprache/Gesang/Musik in über 100 Sprachen. FireRedLID unterstützt über 100 Sprachen und über 20 chinesische Dialekte. FireRedPunc unterstützt Chinesisch und Englisch.
★ 669+12Sterne-Änderung der letzten 7 Tage