跳到主要内容
buildradar
登录
主题 · vision-language-model

vision-language-model

标记 vision-language-model 主题、收录中的开源项目,按星标数排序。

共 59 个项目
  • prismer@NVlabs

    “Prismer: A Vision-Language Model with Multi-Task Experts”的实现。

    1,309+0近 7 天星标变化
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    用于民主化多模态训练的完全开放框架

    1,195+0近 7 天星标变化
  • vlms-zero-to-hero@SkalskiP

    本系列将带领您从 NLP 与 Computer Vision 的基础,一路探索至 Vision-Language Models 的尖端技术。

    1,179+0近 7 天星标变化
  • doc7@magicrew

    通过视觉理解将文档转换为具备 AI 处理能力的 Markdown

    1,153+0近 7 天星标变化
  • 为纯文本模型“看图”设计更好的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+0近 7 天星标变化
  • VisRAG@OpenBMB

    由 VLM 支持的无解析 RAG

    979+0近 7 天星标变化
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM),同类型中的首款模型,能够生成与对象分割遮罩无缝整合的自然语言响应。

    967+0近 7 天星标变化
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi:统一视觉表示赋能大型语言模型具备图像与视频理解能力

    941+0近 7 天星标变化
  • 这个仓库精选了 CVPR 2025 最令人兴奋且最具影响力的论文。🔥 [论文 + 代码 + 演示]

    895+1近 7 天星标变化
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP:一个能专注于你指定位置的 CLIP 模型

    875+1近 7 天星标变化
  • dsh-vision-toolkit@Anionex

    [dsh] 为纯文字模型设计更强大的视觉工具箱:安装免费使用、贴上图片直接识别、多张图片问答、截图到前端 UI 还原等 | DeepSeek Harness 原生整合 agent-vision-toolkit:图片问答、长截图 OCR、UI 还原、定位、像素 diff、Artifacts 与 Web UI。

    868+18近 7 天星标变化
  • VoxPoser@huangwl18

    VoxPoser:使用语言模型进行机器人操作的可组合 3D 价值映射

    834+1近 7 天星标变化
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA:电脑使用代理的开放基础

    834+2近 7 天星标变化
  • MINT-1T@mlfoundations

    🍃 MINT-1T:一个包含一万亿个 token 的多模态交错数据集。

    833+1近 7 天星标变化
  • 受 awesome-computer-vision 启发,精选大模型(即 LLM/VLM)时代下与机器人领域相关的 3D 视觉论文清单,包含论文、代码及相关网站

    822+2近 7 天星标变化
  • 精选的视觉语言模型(如 CLIP)提示词/适配器学习方法列表。

    796+0近 7 天星标变化
  • X-VLA@2toinf

    [ICLR 2026]“Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model”官方实现

    728+6近 7 天星标变化
  • OmniVinci@NVlabs

    OmniVinci 是一个用于联合理解视觉、语音和语言的全模态 LLM。

    679+1近 7 天星标变化
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    641-1近 7 天星标变化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    620+88近 7 天星标变化
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID:一个具有空间标注的大规模视频数据集

    601+1近 7 天星标变化
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT:基于预训练模型的持续学习工具箱

    601+1近 7 天星标变化
  • t2v_metrics@linzhiqiu

    使用 VQAScore 评估文字转图像/视频/3D 模型

    600+0近 7 天星标变化
  • Groma@FoundationVision

    [ECCV2024] 具备局部视觉标记化功能的接地多模态大型语言模型

    586+0近 7 天星标变化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一个统一的大型多模态模型 (LMM),能以高效方式支持图像、高分辨率图像及视频的理解。

    577+0近 7 天星标变化
  • cambrian-s@cambrian-mllm

    Cambrian-S:迈向影片中的空间超感知

    567-1近 7 天星标变化
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena 遇上多模态!Multi-Modality Arena 允许您在输入图像的同时,并排评测视觉语言模型。支持 MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2 等多种模型!

    565+0近 7 天星标变化
  • Flame-Code-VLM@Flame-Code-VLM

    Flame 是一个开源的多模态 AI 系统,旨在将 UI 设计稿转换为高质量的 React 代码。它利用视觉语言模型、自动化数据合成与结构化训练工作流程,缩短设计与前端开发之间的差距。

    562+0近 7 天星标变化
  • count-anything@Mengqi-Lei

    Counting Anything 论文的代码与实现指南。项目页面:https://mengqi-lei.github.io/count-anything-projectpage/

    541+5近 7 天星标变化
← 返回主题列表