vision-language-model
標記 vision-language-model 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 vision-language-model 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 vision-language-model 主題的專案。
- #1★ 1,153
- #2
為純文字模型「看圖」設計更好的視覺工具箱和技能,支援多圖理解、圖片問答、前端UI還原、GUI 自動化等,並可選無縫接入多個主流agent,直接識別貼上圖片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 1,136 - #3
[dsh] 為純文字模型設計更強大的視覺工具箱:安裝免費使用、貼上圖片直接識別、多張圖片問答、截圖到前端 UI 還原等 | DeepSeek Harness 原生整合 agent-vision-toolkit:圖片問答、長截圖 OCR、UI 還原、定位、像素 diff、Artifacts 與 Web UI。
★ 856 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1★ 25,014+9近 7 天星數變化
- #2
X-AnyLabeling:輕量、高效、統一的跨平台桌面標註應用,支援文字、影像、影片與多模態資料,結合多功能內建工具、最先進 AI 模型與彈性多格式匯出
★ 10,313+59近 7 天星數變化 - #3★ 10,150+3近 7 天星數變化
- #4
👀 只需 2 小時即可從頭訓練 6500 萬參數的視覺語言模型
★ 8,535+40近 7 天星數變化 - #5★ 6,727+1近 7 天星數變化
- #6
MineContext 是您的主動式上下文感知 AI 合作夥伴(Context-Engineering+ChatGPT Pulse)
★ 5,497+1近 7 天星數變化 - #7★ 5,462+25近 7 天星數變化
- #8
Align Anything:使用回饋訓練全模態模型
★ 4,671+3近 7 天星數變化 - #9★ 4,390+7近 7 天星數變化
- #10
DeepSeek-VL:邁向實際世界的視覺-語言理解
★ 4,177+2近 7 天星數變化 - #11
MiniMax-Text-01 与 MiniMax-VL-01 官方仓库,基于 Linear Attention 的大语言模型与视觉语言模型
★ 3,467+0近 7 天星數變化 - #12★ 3,327+0近 7 天星數變化
- #13
用於視覺任務的精選視覺語言模型合集
★ 3,126+0近 7 天星數變化 - #14
離線 AI 的瑞士刀。在手機或 Mac 上進行聊天、視覺辨識、語音對話與圖像生成——支援 GGUF LLMs、視覺、Whisper 語音轉文字、Stable Diffusion、工具呼叫以及本機網路伺服器。可在 CPU、GPU 或 NPU 上運行。無需帳號、無需 API 金鑰,資料零外洩。
★ 3,038+17近 7 天星數變化 - #15
InternLM-XComposer2.5-OmniLive:一個全面的多模態系統,用於長期串流視頻與音頻互動
★ 2,925-1近 7 天星數變化 - #16★ 2,809+7近 7 天星數變化
- #17
Cradle 框架是通用電腦控制(GCC)的首次嘗試。Cradle 透過在具備最低要求的標準化通用環境中提供強大的推理能力、自我改善與技能策劃,支援智慧體精通任何電腦任務。
★ 2,578+2近 7 天星數變化 - #18
阿里巴巴開源的 Qwen-VL 系列微調開源實現。
★ 1,961+1近 7 天星數變化 - #19★ 1,896+2近 7 天星數變化
- #20
自動駕駛領域優秀的 LLM/VLM/VLA/世界模型資源精選列表(持續更新)
★ 1,890-2近 7 天星數變化 - #21
NVIDIA 影片搜尋與摘要 (VSS) AI Blueprint 是一個 GPU 加速的參考架構,用於建構具備即時驗證警報、視覺化問答與自動化報告功能的影片分析代理程式。VSS Blueprint 採用如 NVIDIA Cosmos 等視覺語言模型 (VLM)、如 NVIDIA Nemotron 等 LLM、RAG 以及 NVIDIA NIM。
★ 1,840+10近 7 天星數變化 - #22
朝向先進文學機器(Advanced Literate Machinery)的原創創新點子與演算法集合。本專案由阿里巴巴集團通義實驗室語言技術實驗室 OCR 團隊維護。
★ 1,835+1近 7 天星數變化 - #23
Seed1.5-VL 是一個視覺-語言基礎模型,旨在推進通用多模態理解與推理,在 60 個公開基準測試中的 38 個達到頂尖效能。
★ 1,586+0近 7 天星數變化 - #24
針對 Apple Silicon 的高效能 OpenAI 與 Anthropic 相容 LLM 推論伺服器。原生支援 MLX、連續批次處理、多模態模型、MCP 工具呼叫以及 Claude Code。
★ 1,557+6近 7 天星數變化 - #25★ 1,524+0近 7 天星數變化
- #26
[ICCV 2025] Describe Anything 的實作:詳細的局部區域影像與影片字幕生成
★ 1,517+3近 7 天星數變化 - #27★ 1,514+2近 7 天星數變化
- #28
日本語LLM總結 - 日本語LLM概覽
★ 1,428+1近 7 天星數變化 - #29
在配備 Apple Silicon 的 Mac 上微調 LLMs。支援 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 與 OCR 微調 —— 基於 MLX 原生實現。相容 Unsloth API。
★ 1,398+8近 7 天星數變化 - #30
精選的統一多模態模型清單
★ 1,314+1近 7 天星數變化