Zum Hauptinhalt springen
buildradar
Sign in
Thema · mllm

mllm

Erfasste Open-Source-Repos mit dem Tag mllm, sortiert nach Sternen.

36 Repos
  • ComfyUI_VLM_nodes@gokayfem

    ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.

    588+1Sterne-Änderung der letzten 7 Tage
  • JanusVLN@MIV-XJTU

    [ICLR2026] Offizielle Implementierung für "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation".

    588+4Sterne-Änderung der letzten 7 Tage
  • Groma@FoundationVision

    [ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

    586+0Sterne-Änderung der letzten 7 Tage
  • Vitron@SkyworkAI

    NeurIPS 2024 Paper: Ein einheitliches Pixel-basiertes Vision LLM für Verständnis, Generierung, Segmentierung und Bearbeitung

    577+1Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von Forschungsarbeiten zur LLM-basierten multimodalen Generierung (Bild, Video, 3D und Audio).

    552+0Sterne-Änderung der letzten 7 Tage
  • Awesome Multimodal Modeling [Umfasst MLLM, UMM und NMM].

    543+3Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen