跳到主要內容
buildradar
登入
主題 · vision-language-model

vision-language-model

標記 vision-language-model 主題、收錄中的開源專案,依星數排序。

共 59 個專案
  • prismer@NVlabs

    「Prismer: A Vision-Language Model with Multi-Task Experts」的實作。

    1,309+0近 7 天星數變化
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    用於民主化多模態訓練的完全開放框架

    1,195+0近 7 天星數變化
  • vlms-zero-to-hero@SkalskiP

    本系列將帶領您從 NLP 與 Computer Vision 的基礎,一路探索至 Vision-Language Models 的尖端技術。

    1,179+0近 7 天星數變化
  • doc7@magicrew

    透過視覺理解將文件轉換為具備 AI 處理能力的 Markdown

    1,153+0近 7 天星數變化
  • 為純文字模型「看圖」設計更好的視覺工具箱和技能,支援多圖理解、圖片問答、前端UI還原、GUI 自動化等,並可選無縫接入多個主流agent,直接識別貼上圖片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+0近 7 天星數變化
  • VisRAG@OpenBMB

    由 VLM 支援的無解析 RAG

    979+0近 7 天星數變化
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM),同類型中的首款模型,能夠產生與物件分割遮罩無縫整合的自然語言回應。

    967+0近 7 天星數變化
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi:統一視覺表示賦能大型語言模型具備圖像與影片理解能力

    941+0近 7 天星數變化
  • 這個儲存庫精選了 CVPR 2025 最令人興奮且最具影響力的論文。🔥 [論文 + 程式碼 + 展示]

    895+1近 7 天星數變化
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP:一個能專注於你指定位置的 CLIP 模型

    875+1近 7 天星數變化
  • dsh-vision-toolkit@Anionex

    [dsh] 為純文字模型設計更強大的視覺工具箱:安裝免費使用、貼上圖片直接識別、多張圖片問答、截圖到前端 UI 還原等 | DeepSeek Harness 原生整合 agent-vision-toolkit:圖片問答、長截圖 OCR、UI 還原、定位、像素 diff、Artifacts 與 Web UI。

    868+18近 7 天星數變化
  • VoxPoser@huangwl18

    VoxPoser:使用語言模型進行機器人操作的可組合 3D 價值對應

    834+1近 7 天星數變化
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA:電腦使用代理的開放基礎

    834+2近 7 天星數變化
  • MINT-1T@mlfoundations

    🍃 MINT-1T:一個包含一兆個 token 的多模態交錯資料集。

    833+1近 7 天星數變化
  • 受 awesome-computer-vision 啟發,精選大模型(即 LLM/VLM)時代下與機器人領域相關的 3D 視覺論文清單,包含論文、程式碼及相關網站

    822+2近 7 天星數變化
  • 精選的視覺語言模型(如 CLIP)提示詞/適配器學習方法清單。

    796+0近 7 天星數變化
  • X-VLA@2toinf

    [ICLR 2026]「Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model」官方實作

    728+6近 7 天星數變化
  • OmniVinci@NVlabs

    OmniVinci 是一個用於聯合理解視覺、語音和語言的全模態 LLM。

    679+1近 7 天星數變化
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    641-1近 7 天星數變化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    620+88近 7 天星數變化
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID:一個具有空間標註的大規模影片資料集

    601+1近 7 天星數變化
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT:基於預訓練模型的持續學習工具箱

    601+1近 7 天星數變化
  • t2v_metrics@linzhiqiu

    使用 VQAScore 評估文字轉圖像/影片/3D 模型

    600+0近 7 天星數變化
  • Groma@FoundationVision

    [ECCV2024] 具備局部視覺標記化功能的接地多模態大型語言模型

    586+0近 7 天星數變化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一個統一的大型多模態模型 (LMM),能以高效方式支援圖像、高解析度圖像及影片的理解。

    577+0近 7 天星數變化
  • cambrian-s@cambrian-mllm

    Cambrian-S:邁向影片中的空間超感知

    567-1近 7 天星數變化
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena 遇上多模態!Multi-Modality Arena 允許您在輸入影像的同時,並排評測視覺語言模型。支援 MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2 等多種模型!

    566+0近 7 天星數變化
  • Flame-Code-VLM@Flame-Code-VLM

    Flame 是一個開源的多模態 AI 系統,旨在將 UI 設計稿轉換為高品質的 React 程式碼。它利用視覺語言模型、自動化資料合成與結構化訓練工作流程,縮短設計與前端開發之間的差距。

    562+0近 7 天星數變化
  • count-anything@Mengqi-Lei

    Counting Anything 論文的程式碼與實作指南。專案頁面:https://mengqi-lei.github.io/count-anything-projectpage/

    541+5近 7 天星數變化
← 返回主題列表