Zum Hauptinhalt springen
buildradar
Sign in
Thema · vision-language-model

vision-language-model

Erfasste Open-Source-Repos mit dem Tag vision-language-model, sortiert nach Sternen.

59 Repos
  • prismer@NVlabs

    Die Implementierung von „Prismer: A Vision-Language Model with Multi-Task Experts“.

    1.309+0Sterne-Änderung der letzten 7 Tage
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Vollständig offenes Framework für demokratisiertes multimodales Training

    1.195+1Sterne-Änderung der letzten 7 Tage
  • vlms-zero-to-hero@SkalskiP

    Diese Reihe nimmt Sie mit auf eine Reise von den Grundlagen der NLP und Computer Vision bis hin zu den neuesten Vision-Language-Modellen.

    1.179+0Sterne-Änderung der letzten 7 Tage
  • doc7@magicrew

    Konvertieren Sie Dokumente mit visueller Erkennung in KI-ready Markdown

    1.153-25Sterne-Änderung der letzten 7 Tage
  • Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode

    1.136+18Sterne-Änderung der letzten 7 Tage
  • VisRAG@OpenBMB

    Parsing-freies RAG, unterstützt durch VLMs

    979-1Sterne-Änderung der letzten 7 Tage
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), das weltweit erste Modell, das natürlichsprachliche Antworten generieren kann, die nahtlos in Objektdegmentierungsmasken integriert sind.

    967+0Sterne-Änderung der letzten 7 Tage
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

    941+0Sterne-Änderung der letzten 7 Tage
  • Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2025 Paper. 🔥 [Paper + Code + Demo]

    895+1Sterne-Änderung der letzten 7 Tage
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Ein CLIP-Modell, das sich auf beliebige Bereiche konzentriert

    874+0Sterne-Änderung der letzten 7 Tage
  • dsh-vision-toolkit@Anionex

    DeepSeek-Harness-native Integration für agent-vision-toolkit: Bild-Q&A, Long-Screenshot-OCR, UI-Wiederherstellung, Grounding, Pixel-Diff, Artifacts und Web-UI.

    856+15Sterne-Änderung der letzten 7 Tage
  • VoxPoser@huangwl18

    VoxPoser: Kombinierbare 3D-Wertkarten für die Robotermanipulation mit Sprachmodellen

    834+1Sterne-Änderung der letzten 7 Tage
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: Open Foundations für Computer-Use Agents

    833+4Sterne-Änderung der letzten 7 Tage
  • MINT-1T@mlfoundations

    🍃 MINT-1T: Ein multimodaler, verschränkter Datensatz mit einer Billion Token.

    832+0Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von 3D-Vision-Papern mit Bezug zur Robotik im Zeitalter großer Modelle wie LLMs/VLMs, inspiriert von awesome-computer-vision, einschließlich Papers, Codes und zugehörigen Websites

    821+1Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste fantastischer Prompt-/Adapter-Lernmethoden für Vision-Language-Modelle wie CLIP.

    797+1Sterne-Änderung der letzten 7 Tage
  • X-VLA@2toinf

    [ICLR 2026] Die offizielle Implementierung von „Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model“

    725+4Sterne-Änderung der letzten 7 Tage
  • OmniVinci@NVlabs

    OmniVinci ist ein omnimodales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.

    677+0Sterne-Änderung der letzten 7 Tage
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Sterne-Änderung der letzten 7 Tage
  • LAMDA-PILOT@LAMDA-CL

    PILOT: Eine Toolbox für vortrainiertes, modellbasiertes kontinuierliches Lernen.

    600+3Sterne-Änderung der letzten 7 Tage
  • t2v_metrics@linzhiqiu

    Evaluierung von Text-zu-Bild/Video/3D-Modellen mit VQAScore.

    600+0Sterne-Änderung der letzten 7 Tage
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: Ein umfangreicher Video-Datensatz mit räumlichen Annotationen.

    600+1Sterne-Änderung der letzten 7 Tage
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Sterne-Änderung der letzten 7 Tage
  • Groma@FoundationVision

    [ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

    586+0Sterne-Änderung der letzten 7 Tage
  • LLaVA-Mini@ictnlp

    LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.

    577+0Sterne-Änderung der letzten 7 Tage
  • cambrian-s@cambrian-mllm

    Cambrian-S: Auf dem Weg zur räumlichen Super-Sensorik in Videos

    567+0Sterne-Änderung der letzten 7 Tage
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena trifft auf Multimodalität! Multi-Modality Arena ermöglicht es, Vision-Language-Modelle nebeneinander zu benchmarken, während Bilder als Eingaben bereitgestellt werden. Unterstützt MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 und viele weitere!

    566+0Sterne-Änderung der letzten 7 Tage
  • Flame-Code-VLM@Flame-Code-VLM

    Flame ist ein Open-Source multimodales KI-System zur Umwandlung von UI-Design-Mockups in hochwertigen React-Code. Es nutzt Vision-Language-Modelle und automatisierte Workflows, um die Lücke zwischen Design und Frontend-Entwicklung zu schließen.

    562+0Sterne-Änderung der letzten 7 Tage
  • count-anything@Mengqi-Lei

    Code und Implementierungsrichtlinien für das Paper Counting Anything. Projektseite: https://mengqi-lei.github.io/count-anything-projectpage/

    538+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen