跳到主要内容
buildradar
Sign in
主题 · mllm

mllm

标记 mllm 主题、收录中的开源项目,按星标数排序。

项目数
36
总星标数
92,155
平均星标数
2,560
占比
0.00%

常跟 mllm 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 mllm 主题的项目。

  • unilm@microsoft

    跨任务、语言和模态的大规模自监督预训练

    22,203+7近 7 天星标变化
  • Agent-S@simular-ai

    Agent S:一个使用电脑如同人类的开放代理框架

    12,219+17近 7 天星标变化
  • MobileAgent@X-PLUG

    Mobile-Agent:功能强大的 GUI 代理系列

    9,157+9近 7 天星标变化
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM:训练大型语言模型以进行结构化室内建模

    4,726+3近 7 天星标变化
  • MagicQuill@robbyant-research

    [CVPR'25] 文章官方实现 - MagicQuill:一个智能互动图像编辑系统

    3,691+2近 7 天星标变化
  • 从 Chain-of-Thought 提示到 OpenAI o1 与 DeepSeek-R1

    3,681+3近 7 天星标变化
  • NExT-GPT@NExT-GPT

    ICML 2024 论文 NExT-GPT 的代码与模型,Any-to-Any 多模态大型语言模型

    3,634-2近 7 天星标变化
  • Eagle@NVlabs

    Eagle:采用以数据为中心策略的前沿视觉语言模型

    3,511+32近 7 天星标变化
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:一个全面的多模态系统,用于长期串流视频与音频互动

    2,925-1近 7 天星标变化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型

    2,411+0近 7 天星标变化
  • cambrian@cambrian-mllm

    Cambrian-1 是一个采用视觉中心设计的多模态 LLM 系列。

    2,014+1近 7 天星标变化
  • 🚀🚀🚀 一些优秀的公开 YOLO 对象检测系列项目与相关对象检测数据集的集合。

    1,783-2近 7 天星标变化
  • Sa2VA@bytedance

    Pixel-LLM 代码库官方存储库:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA (LSVOS 第一名解决方案)

    1,666+0近 7 天星标变化
  • Rex-Omni@IDEA-Research

    [CVPR2026] 通过下一个点预测来检测任何东西

    1,570+8近 7 天星标变化
  • 包含 155 种以上 VLM/MLLM 架构的精选视觉化目录:包含论文、图表、训练配方、数据集,以及多模态 AI 代理的发布时间轴。

    1,310+2近 7 天星标变化
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    用于民主化多模态训练的完全开放框架

    1,195+1近 7 天星标变化
  • Bunny@BAAI-DCAI

    一系列轻量级多模态模型。

    1,053+0近 7 天星标变化
  • OpenEMMA@taco-group

    OpenEMMA,Waymo EMMA 模型的宽松授权开源“重现”版本。

    951+0近 7 天星标变化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:从第一性原理构建的原生视觉语言模型

    889+1近 7 天星标变化
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: 通过智能照片修饰代理程序释放人类艺术创造力

    862+1近 7 天星标变化
  • Osprey@CircleRadon

    [CVPR2024] “Osprey: Pixel Understanding with Visual Instruction Tuning” 代码

    843+0近 7 天星标变化
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 spotlight]「FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving」的官方实现

    831+9近 7 天星标变化
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent:Agentic 任意影像转 4K 超分辨率。一个能将任何影像神奇还原至完美 4K 的智慧型电脑视觉 Agent!

    822+3近 7 天星标变化
  • 🚀🚀🚀 收集一些关于大型语言模型(LLM)、视觉语言模型(VLM)、视觉语言动作(VLA)、AI 生成内容(AIGC)以及相关数据集与应用的优秀公开项目。

    815+1近 7 天星标变化
  • 这是一个用于收录场景图生成与应用相关论文的仓库。

    725+6近 7 天星标变化
  • MPP-LLaVA@Coobiw

    个人项目:MPP-Qwen14B & MPP-Qwen-Next(基于 Qwen-LM 的多模态流水线并行)。支持 [视频/图像/多图] {SFT/对话}。不要让贫穷限制您的想象力!在 RTX3090/4090 24GB 上训练您自己的 8B/14B LLaVA 风格 MLLM。

    687+1近 7 天星标变化
  • SenseNova-Vision@OpenSenseNova

    视觉作为统一的多模态生成

    683+28近 7 天星标变化
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: 多模态大型语言模型的幻觉修正

    650+1近 7 天星标变化
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield:通过多模态大语言模型进行可解释的图像篡改检测与定位

    623+2近 7 天星标变化
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA:通过指令微调的多模态情感识别与推理

    618+1近 7 天星标变化
← 返回主题列表