large-multimodal-models
Erfasste Open-Source-Repos mit dem Tag large-multimodal-models, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit large-multimodal-models am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit large-multimodal-models getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
✨✨[NeurIPS 2025] VITA-1.5: Auf dem Weg zu Echtzeit-Vision- und Sprachinteraktion auf GPT-4o-Niveau
★ 2.532-1Sterne-Änderung der letzten 7 Tage - #2
[ICCV 2025] Implementierung für Describe Anything: Detaillierte lokalisierte Bild- und Video-Beschriftung
★ 1.517+3Sterne-Änderung der letzten 7 Tage - #3
Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.
★ 1.310+2Sterne-Änderung der letzten 7 Tage - #4
[NeurIPS 2024] Eine offizielle Implementierung von „ShareGPT4Video: Improving Video Understanding and Generation with Better Captions“
★ 1.094+1Sterne-Änderung der letzten 7 Tage - #5
Ein Framework für kleine, große multimodale Modelle
★ 1.004+1Sterne-Änderung der letzten 7 Tage - #6
Eine Sammlung von Ressourcen zu Anwendungen des multimodalen Lernens in der medizinischen Bildgebung.
★ 975+1Sterne-Änderung der letzten 7 Tage - #7
LLaVA-Plus: Große Sprach- und Bildassistenten, die sich einstecken lassen und lernen, Fähigkeiten zu nutzen
★ 770+0Sterne-Änderung der letzten 7 Tage - #8
Dieses Repository enthält Evaluierungscode für das Paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 593+1Sterne-Änderung der letzten 7 Tage - #9
LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.
★ 577+0Sterne-Änderung der letzten 7 Tage