vision-language-model
标记 vision-language-model 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 vision-language-model 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 vision-language-model 主题的项目。
- #1★ 1,153
- #2
为纯文本模型“看图”设计更好的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136 - #3
[dsh] 为纯文字模型设计更强大的视觉工具箱:安装免费使用、贴上图片直接识别、多张图片问答、截图到前端 UI 还原等 | DeepSeek Harness 原生整合 agent-vision-toolkit:图片问答、长截图 OCR、UI 还原、定位、像素 diff、Artifacts 与 Web UI。
★ 859 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1★ 25,014+9近 7 天星标变化
- #2
X-AnyLabeling:轻量、高效、统一的跨平台桌面标注应用,支持文字、图像、视频与多模态数据,结合多功能内置工具、最先进 AI 模型与灵活多格式导出
★ 10,313+59近 7 天星标变化 - #3★ 10,150+3近 7 天星标变化
- #4
👀 只需 2 小时即可从头训练 6500 万参数的视觉语言模型
★ 8,535+40近 7 天星标变化 - #5★ 6,727+1近 7 天星标变化
- #6
MineContext 是您的主动式上下文感知 AI 合作伙伴(Context-Engineering+ChatGPT Pulse)
★ 5,497+1近 7 天星标变化 - #7★ 5,462+25近 7 天星标变化
- #8
Align Anything:使用反馈训练全模态模型
★ 4,671+3近 7 天星标变化 - #9★ 4,390+7近 7 天星标变化
- #10
DeepSeek-VL:迈向实际世界的视觉-语言理解
★ 4,177+2近 7 天星标变化 - #11
MiniMax-Text-01 与 MiniMax-VL-01 官方仓库,基于 Linear Attention 的大语言模型与视觉语言模型
★ 3,467+0近 7 天星标变化 - #12★ 3,327+0近 7 天星标变化
- #13
用於視覺任務的精選視覺語言模型合集
★ 3,126+0近 7 天星标变化 - #14
离线 AI 的瑞士军刀。在手机或 Mac 上进行聊天、视觉识别、语音对话与图像生成——支持 GGUF LLMs、视觉、Whisper 语音转文字、Stable Diffusion、工具调用以及本地网络服务器。可在 CPU、GPU 或 NPU 上运行。无需账号、无需 API 密钥,数据零外泄。
★ 3,038+17近 7 天星标变化 - #15
InternLM-XComposer2.5-OmniLive:一个全面的多模态系统,用于长期串流视频与音频互动
★ 2,925-1近 7 天星标变化 - #16★ 2,809+7近 7 天星标变化
- #17
Cradle 框架是通用计算机控制(GCC)的首次尝试。Cradle 通过在具备最低要求的标准化通用环境中提供强大的推理能力、自我改进与技能策划,支持智能体精通任何计算机任务。
★ 2,578+2近 7 天星标变化 - #18
阿里巴巴开源的 Qwen-VL 系列微调开源实现。
★ 1,961+1近 7 天星标变化 - #19★ 1,896+2近 7 天星标变化
- #20
自动驾驶领域优秀的 LLM/VLM/VLA/世界模型资源精选列表(持续更新)
★ 1,890-2近 7 天星标变化 - #21
NVIDIA 视频搜索与摘要 (VSS) AI Blueprint 是一个 GPU 加速的参考架构,用于构建具备实时验证警报、可视化问答与自动化报告功能的视频分析代理程序。VSS Blueprint 采用如 NVIDIA Cosmos 等视觉语言模型 (VLM)、如 NVIDIA Nemotron 等 LLM、RAG 以及 NVIDIA NIM。
★ 1,840+10近 7 天星标变化 - #22
朝向高级文学机器(Advanced Literate Machinery)的原创创新点子与算法集合。本项目由阿里巴巴集团通义实验室语言技术实验室 OCR 团队维护。
★ 1,835+1近 7 天星标变化 - #23
Seed1.5-VL 是一个视觉-语言基础模型,旨在推进通用多模态理解与推理,在 60 个公开基准测试中的 38 个达到顶尖性能。
★ 1,586+0近 7 天星标变化 - #24
针对 Apple Silicon 的高性能 OpenAI 与 Anthropic 兼容 LLM 推理服务器。原生支持 MLX、连续批处理、多模态模型、MCP 工具调用以及 Claude Code。
★ 1,557+6近 7 天星标变化 - #25★ 1,524+0近 7 天星标变化
- #26
[ICCV 2025] Describe Anything 的实现:详细的局部区域图像与视频字幕生成
★ 1,517+3近 7 天星标变化 - #27★ 1,514+2近 7 天星标变化
- #28
日本語LLM总结 - 日本语LLM概览
★ 1,428+1近 7 天星标变化 - #29
在配备 Apple Silicon 的 Mac 上微调 LLMs。支持 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 与 OCR 微调 —— 基于 MLX 原生实现。兼容 Unsloth API。
★ 1,398+8近 7 天星标变化 - #30
精选的统一多模态模型列表
★ 1,314+1近 7 天星标变化