multimodal
标记 multimodal 主题、收录中的开源项目,按星标数排序。
- #91
为纯文本模型“看图”设计更好的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136+0近 7 天星标变化 - #92
应用程序的自我编码系统 — 适用于 Cordova 的 Alan AI SDK
★ 1,132+0近 7 天星标变化 - #93
SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。
★ 1,118+56近 7 天星标变化 - #94★ 1,110+2近 7 天星标变化
- #95
专为纯文本 DeepSeek Harness 代理设计的视觉眼:内置免费视觉链(无需密钥)与像素级视觉工具(问答、定位、裁剪、像素差异、颜色、OCR、SVG 描摹、抠图、截图)。一键安装,无需 Python,图片处理就像一般的工具调用一样。
★ 1,096+45近 7 天星标变化 - #96★ 1,088+1近 7 天星标变化
- #97
🩺 首个会看胸部 X 光片的中文多模态医学大模型 | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.
★ 1,085+2近 7 天星标变化 - #98★ 1,061-1近 7 天星标变化
- #99
跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0近 7 天星标变化 - #100★ 1,054+2近 7 天星标变化
- #101★ 1,033+2近 7 天星标变化
- #102
多模态思维链推理:综合调查
★ 1,025+1近 7 天星标变化 - #103★ 1,018+8近 7 天星标变化
- #104★ 983+49近 7 天星标变化
- #105
结合向量搜索与 LLM 的多模态 AI、RAG 与 Agent 资源、示例与教程
★ 973+0近 7 天星标变化 - #106★ 902+1近 7 天星标变化
- #107
这个仓库精选了 CVPR 2025 最令人兴奋且最具影响力的论文。🔥 [论文 + 代码 + 演示]
★ 895+1近 7 天星标变化 - #108★ 890+2近 7 天星标变化
- #109★ 881-1近 7 天星标变化
- #110
⚡ 使用 FastAPI、Playwright 与兼容 OpenAI 的多模态模型构建的自托管、兼容 YesCaptcha 的验证码破解工具。
★ 870+1近 7 天星标变化 - #111
一个简单、统一的多模态模型训练引擎。精简、灵活,专为大规模修改与实验打造。
★ 825+1近 7 天星标变化 - #112
[TMLR 2025🔥] 视觉自回归模型综述。
★ 808+0近 7 天星标变化 - #113★ 802+0近 7 天星标变化
- #114
在 PyTorch 中进行对比模型训练
★ 802+0近 7 天星标变化 - #115
本地监控 + AI 视觉 — 基于局域网、由智能手机驱动的 AI 监控框架,提供用于数据采集和分析的结构化事件输出。
★ 797+11近 7 天星标变化 - #116
多模态与大型语言模型论文列表,仅用于记录个人日常在 arXiv 上阅读的论文。
★ 761+0近 7 天星标变化 - #117
[ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR
★ 743+1近 7 天星标变化 - #118★ 723-1近 7 天星标变化
- #119★ 690+2近 7 天星标变化
- #120
此仓库包含“VLM2Vec / MMEB”[ICLR 2025]、“VLM2Vec-V2 / MMEB-V2”[TMLR 2026] 以及“MMEB-V3”[COLM 2026] 的代码
★ 683+2近 7 天星标变化