跳到主要內容
buildradar
Sign in
主題 · mllm

mllm

標記 mllm 主題、收錄中的開源專案,依星數排序。

專案數
36
總星數
92,155
平均星數
2,560
佔比
0.00%

常跟 mllm 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 mllm 主題的專案。

  • unilm@microsoft

    跨任務、語言與模態的大規模自監督預訓練

    22,203+7近 7 天星數變化
  • Agent-S@simular-ai

    Agent S:一個使用電腦如同人類的開放代理框架

    12,219+17近 7 天星數變化
  • MobileAgent@X-PLUG

    Mobile-Agent:功能強大的 GUI 代理系列

    9,157+9近 7 天星數變化
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM:訓練大型語言模型以進行結構化室內建模

    4,726+3近 7 天星數變化
  • MagicQuill@robbyant-research

    [CVPR'25] 文章官方實作 - MagicQuill:一個智能互動圖像編輯系統

    3,691+2近 7 天星數變化
  • 從 Chain-of-Thought 提示到 OpenAI o1 與 DeepSeek-R1

    3,681+3近 7 天星數變化
  • NExT-GPT@NExT-GPT

    ICML 2024 論文 NExT-GPT 的程式碼與模型,Any-to-Any 多模態大型語言模型

    3,634-2近 7 天星數變化
  • Eagle@NVlabs

    Eagle:採用以數據為中心策略的前沿視覺語言模型

    3,511+32近 7 天星數變化
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:一個全面的多模態系統,用於長期串流視頻與音頻互動

    2,925-1近 7 天星數變化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用於文件理解的模組化多模態大型語言模型

    2,411+0近 7 天星數變化
  • cambrian@cambrian-mllm

    Cambrian-1 是一個採用視覺中心設計的多模態 LLM 系列。

    2,014+1近 7 天星數變化
  • 🚀🚀🚀 一些優秀的公開 YOLO 物件偵測系列專案與相關物件偵測資料集的集合。

    1,783-2近 7 天星數變化
  • Sa2VA@bytedance

    Pixel-LLM 程式碼基底官方儲存庫:Sa2VA (T-PAMI-26)、SAMTok (CVPR-26)、VRT (Arxiv-25)、SaSaSa2VA (LSVOS 第一名解決方案)

    1,666+0近 7 天星數變化
  • Rex-Omni@IDEA-Research

    [CVPR2026] 透過下一個點預測來檢測任何東西

    1,570+8近 7 天星數變化
  • 包含 155 種以上 VLM/MLLM 架構的精選視覺化目錄:包含論文、圖表、訓練配方、資料集,以及多模態 AI 代理的發布時間軸。

    1,310+2近 7 天星數變化
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    用於民主化多模態訓練的完全開放框架

    1,195+1近 7 天星數變化
  • Bunny@BAAI-DCAI

    一系列輕量級的多模態模型。

    1,053+0近 7 天星數變化
  • OpenEMMA@taco-group

    OpenEMMA,Waymo EMMA 模型的寬鬆授權開源「重現」版本。

    951+0近 7 天星數變化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:從第一性原理構建的原生視覺語言模型

    889+0近 7 天星數變化
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: 透過智慧相片修飾代理程式釋放人類藝術創造力

    862+1近 7 天星數變化
  • Osprey@CircleRadon

    [CVPR2024] 「Osprey: Pixel Understanding with Visual Instruction Tuning」程式碼

    843+0近 7 天星數變化
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 spotlight]「FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving」的官方實作

    831+9近 7 天星數變化
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent:Agentic 任意影像轉 4K 超解析度。一個能將任何影像神奇還原至完美 4K 的智慧型電腦視覺 Agent!

    822+3近 7 天星數變化
  • 🚀🚀🚀 收集一些關於大型語言模型(LLM)、視覺語言模型(VLM)、視覺語言動作(VLA)、AI 生成內容(AIGC)以及相關資料集與應用的優秀公開專案。

    815+1近 7 天星數變化
  • 這是一個用於列出場景圖生成與應用相關論文的儲存庫。

    725+5近 7 天星數變化
  • MPP-LLaVA@Coobiw

    個人專案:MPP-Qwen14B & MPP-Qwen-Next(基於 Qwen-LM 的多模態管線並行)。支援 [影片/圖片/多圖] {微調/對話}。別讓貧窮限制您的想像力!在 RTX3090/4090 24GB 上訓練您自己的 8B/14B LLaVA 風格 MLLM。

    687+0近 7 天星數變化
  • SenseNova-Vision@OpenSenseNova

    視覺作為統一的多模態生成

    683+27近 7 天星數變化
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: 多模態大型語言模型的幻覺修正

    650+1近 7 天星數變化
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield:透過多模態大型語言模型進行可解釋的影像偽造偵測與定位

    623+2近 7 天星數變化
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA:透過指令微調的多模態情感辨識與推理

    618+0近 7 天星數變化
← 返回主題列表