mllm
Erfasste Open-Source-Repos mit dem Tag mllm, sortiert nach Sternen.
- #31
ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.
★ 588+1Sterne-Änderung der letzten 7 Tage - #32
[ICLR2026] Offizielle Implementierung für "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation".
★ 588+4Sterne-Änderung der letzten 7 Tage - #33
[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
★ 586+0Sterne-Änderung der letzten 7 Tage - #34
NeurIPS 2024 Paper: Ein einheitliches Pixel-basiertes Vision LLM für Verständnis, Generierung, Segmentierung und Bearbeitung
★ 577+1Sterne-Änderung der letzten 7 Tage - #35
Eine kuratierte Liste von Forschungsarbeiten zur LLM-basierten multimodalen Generierung (Bild, Video, 3D und Audio).
★ 552+0Sterne-Änderung der letzten 7 Tage - #36
Awesome Multimodal Modeling [Umfasst MLLM, UMM und NMM].
★ 543+3Sterne-Änderung der letzten 7 Tage