跳到主要内容
buildradar
登录
主题 · multimodal

multimodal

标记 multimodal 主题、收录中的开源项目,按星标数排序。

共 148 个项目
  • 为纯文本模型“看图”设计更好的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+0近 7 天星标变化
  • 应用程序的自我编码系统 — 适用于 Cordova 的 Alan AI SDK

    1,132+0近 7 天星标变化
  • sglang-omni@sgl-project

    SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。

    1,118+56近 7 天星标变化
  • MOVA@OpenMOSS

    MOVA:迈向可扩展且同步的音视频生成

    1,110+2近 7 天星标变化
  • dsh-vision-router@ysr666

    专为纯文本 DeepSeek Harness 代理设计的视觉眼:内置免费视觉链(无需密钥)与像素级视觉工具(问答、定位、裁剪、像素差异、颜色、OCR、SVG 描摹、抠图、截图)。一键安装,无需 Python,图片处理就像一般的工具调用一样。

    1,096+45近 7 天星标变化
  • Aria@rhymes-ai

    Aria 的代码库 - 一个开源的多模态原生 MoE

    1,088+1近 7 天星标变化
  • XrayGLM@WangRongsheng

    🩺 首个会看胸部 X 光片的中文多模态医学大模型 | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.

    1,085+2近 7 天星标变化
  • VisCPM@OpenBMB

    [ICLR'24 spotlight] 中英双语多模态大模型系列(对话与绘图)| 基于 CPM 基础模型的中英双语多模态大模型系列

    1,061-1近 7 天星标变化
  • ONE-PEACE@OFA-Sys

    跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0近 7 天星标变化
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM:赋能大型语言模型理解点云

    1,054+2近 7 天星标变化
  • CLIP4Clip@ArrowLuo

    「CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval」的官方实现

    1,033+2近 7 天星标变化
  • Awesome-MCoT@yaotingwangofficial

    多模态思维链推理:综合调查

    1,025+1近 7 天星标变化
  • tongflow@tong-io

    TongFlow — 多模态 GenAI 工作室

    1,018+8近 7 天星标变化
  • verl-omni@verl-project

    针对扩散与全能模型的多模态 RL 训练框架

    983+49近 7 天星标变化
  • vectordb-recipes@lancedb

    结合向量搜索与 LLM 的多模态 AI、RAG 与 Agent 资源、示例与教程

    973+0近 7 天星标变化
  • rag-time@microsoft

    RAG Time:掌握 RAG 的 5 周学习之旅

    902+1近 7 天星标变化
  • 这个仓库精选了 CVPR 2025 最令人兴奋且最具影响力的论文。🔥 [论文 + 代码 + 演示]

    895+1近 7 天星标变化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:从第一性原理构建的原生视觉语言模型

    890+2近 7 天星标变化
  • AnyGPT@OpenMOSS

    “AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling”的代码

    881-1近 7 天星标变化
  • ohmycaptcha@shenhao-stu

    ⚡ 使用 FastAPI、Playwright 与兼容 OpenAI 的多模态模型构建的自托管、兼容 YesCaptcha 的验证码破解工具。

    870+1近 7 天星标变化
  • lmms-engine@EvolvingLMMs-Lab

    一个简单、统一的多模态模型训练引擎。精简、灵活,专为大规模修改与实验打造。

    825+1近 7 天星标变化
  • [TMLR 2025🔥] 视觉自回归模型综述。

    808+0近 7 天星标变化
  • papermage@allenai

    支持科学论文 NLP 与 CV 研究的库

    802+0近 7 天星标变化
  • contrastors@nomic-ai

    在 PyTorch 中进行对比模型训练

    802+0近 7 天星标变化
  • 本地监控 + AI 视觉 — 基于局域网、由智能手机驱动的 AI 监控框架,提供用于数据采集和分析的结构化事件输出。

    797+11近 7 天星标变化
  • 多模态与大型语言模型论文列表,仅用于记录个人日常在 arXiv 上阅读的论文。

    761+0近 7 天星标变化
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR

    743+1近 7 天星标变化
  • PaddleMIX@PaddlePaddle

    Paddle 多模态整合与探索,支持主流多模态任务,包含端到端大型多模态预训练模型与扩散模型工具箱。具备高性能与灵活性。

    723-1近 7 天星标变化
  • MMRec@enoche

    多模态推荐工具箱。整合 10+ 个模型...

    690+2近 7 天星标变化
  • VLM2Vec@TIGER-AI-Lab

    此仓库包含“VLM2Vec / MMEB”[ICLR 2025]、“VLM2Vec-V2 / MMEB-V2”[TMLR 2026] 以及“MMEB-V3”[COLM 2026] 的代码

    683+2近 7 天星标变化
← 返回主题列表