multimodal-large-language-models
Erfasste Open-Source-Repos mit dem Tag multimodal-large-language-models, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit multimodal-large-language-models am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit multimodal-large-language-models getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
:sparkles::sparkles: Neueste Fortschritte bei multimodalen Large Language Models
★ 17.996+2Sterne-Änderung der letzten 7 Tage - #2
Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie
★ 9.157+9Sterne-Änderung der letzten 7 Tage - #3
StarVector ist ein Basismodell zur SVG-Generierung, das Vektorisierung in eine Code-Generierungsaufgabe umwandelt. Unter Verwendung einer Vision-Language-Modellarchitektur verarbeitet StarVector sowohl visuelle als auch textuelle Eingaben, um qualitativ hochwertigen SVG-Code mit bemerkenswerter Präzision zu erzeugen.
★ 4.567+6Sterne-Änderung der letzten 7 Tage - #4
LLaMA-Omni ist ein latenzarmes und qualitativ hochwertiges End-to-End-Sprachinteraktionsmodell auf Basis von Llama-3.1-8B-Instruct mit dem Ziel, Sprachfunktionen auf GPT-4o-Niveau zu erreichen.
★ 3.147+1Sterne-Änderung der letzten 7 Tage - #5
Ein plattformübergreifendes Framework zur Videostrukturierung (Videoanalyse) basierend auf CV-Modellen und mLLMs.
★ 2.933+0Sterne-Änderung der letzten 7 Tage - #6
✨✨[NeurIPS 2025] VITA-1.5: Auf dem Weg zu Echtzeit-Vision- und Sprachinteraktion auf GPT-4o-Niveau
★ 2.532-1Sterne-Änderung der letzten 7 Tage - #7
mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis
★ 2.411+0Sterne-Änderung der letzten 7 Tage - #8
Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.
★ 2.014+1Sterne-Änderung der letzten 7 Tage - #9
[ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs (RPG)
★ 1.844+0Sterne-Änderung der letzten 7 Tage - #10
Seed1.5-VL, ein Vision-Language-Grundlagenmodell für allgemeines multimodales Verständnis und Schließen, das bei 38 von 60 öffentlichen Benchmarks branchenführende Ergebnisse erzielt.
★ 1.586+0Sterne-Änderung der letzten 7 Tage - #11
Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.
★ 1.514+2Sterne-Änderung der letzten 7 Tage - #12
Awesome Unified Multimodal Models
★ 1.314+1Sterne-Änderung der letzten 7 Tage - #13
Interaktiver digitaler Mensch in Echtzeit mit anpassbarem Erscheinungsbild und Stimme, Unterstützung für Stimmenklonen und einer Dialogverzögerung von nur 3 Sekunden.
★ 1.303-1Sterne-Änderung der letzten 7 Tage - #14
PyTorch-Implementierung von Audio Flamingo: Eine Reihe fortgeschrittener Sprachmodelle zum Audioverständnis
★ 1.184+2Sterne-Änderung der letzten 7 Tage - #15
Ein Framework für Sprach-, Audio-, Musik- und Textverarbeitung mit Large Language Models
★ 1.058+2Sterne-Änderung der letzten 7 Tage - #16★ 1.053+0Sterne-Änderung der letzten 7 Tage
- #17
Multimodal Chain-of-Thought Reasoning: Eine umfassende Übersicht
★ 1.025+2Sterne-Änderung der letzten 7 Tage - #18
Eine Sammlung von Ressourcen zu Anwendungen des multimodalen Lernens in der medizinischen Bildgebung.
★ 975+1Sterne-Änderung der letzten 7 Tage - #19★ 888+0Sterne-Änderung der letzten 7 Tage
- #20
✨✨ [CVPR 2025] Video-MME: Der allererste umfassende Evaluierungsbenchmark für multimodale LLMs in der Videoanalyse
★ 791+2Sterne-Änderung der letzten 7 Tage - #21
LLaVA-Plus: Große Sprach- und Bildassistenten, die sich einstecken lassen und lernen, Fähigkeiten zu nutzen
★ 770+0Sterne-Änderung der letzten 7 Tage - #22
[CVPR 2024] MovieChat: Von dichten Token zu sparsamem Speicher für das Verständnis langer Videos
★ 706+0Sterne-Änderung der letzten 7 Tage - #23★ 702+0Sterne-Änderung der letzten 7 Tage
- #24
Persönliches Projekt: MPP-Qwen14B & MPP-Qwen-Next (Multimodale Pipeline-Parallelisierung basierend auf Qwen-LM). Unterstützt [Video/Bild/Multi-Bild] {SFT/Konversationen}. Lassen Sie sich nicht von Armut in Ihrer Vorstellungskraft einschränken! Trainieren Sie Ihr eigenes LLaVA-ähnliches MLLM (8B/14B) auf einer RTX3090/4090 mit 24 GB.
★ 686+0Sterne-Änderung der letzten 7 Tage - #25
OmniVinci ist ein omnimodales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.
★ 677+0Sterne-Änderung der letzten 7 Tage - #26
✨✨Woodpecker: Korrektur von Halluzinationen bei multimodalen Large Language Models
★ 650+1Sterne-Änderung der letzten 7 Tage - #27
(Akzeptiert bei IJCV) Liquid: Sprachmodelle sind skalierbare und einheitliche multimodale Generatoren
★ 640+0Sterne-Änderung der letzten 7 Tage - #28
NeurIPS 2024 Paper: Ein einheitliches Pixel-basiertes Vision LLM für Verständnis, Generierung, Segmentierung und Bearbeitung
★ 577+1Sterne-Änderung der letzten 7 Tage - #29
LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.
★ 577+0Sterne-Änderung der letzten 7 Tage - #30
Cambrian-S: Auf dem Weg zur räumlichen Super-Sensorik in Videos
★ 567-1Sterne-Änderung der letzten 7 Tage