multimodal
標記 multimodal 主題、收錄中的開源專案,依星數排序。
- #61
用於與 stability.ai API 互動的 SDK(例如 stable diffusion 推論)。
★ 2,435+0近 7 天星數變化 - #62
mPLUG-DocOwl:用於文件理解的模組化多模態大型語言模型
★ 2,411+0近 7 天星數變化 - #63
[ECCV2024] 用於多模態理解的影片基礎模型與資料
★ 2,374+0近 7 天星數變化 - #64
🎨 NeMo Data Designer:從頭開始或從種子資料生成高品質的合成資料。
★ 2,197+0近 7 天星數變化 - #65
GenAI Processors 是一個輕量級的 Python 程式庫,可實現高效、平行的內容處理。
★ 2,120+0近 7 天星數變化 - #66
讓 Claude(或任何 LLM)真正觀看影片——支援從網址或本地檔案取得具場景感知、去除重複影格與逐字稿的功能。本機執行,採用 MIT 授權。
★ 2,109+0近 7 天星數變化 - #67★ 2,048+0近 7 天星數變化
- #68★ 1,975+0近 7 天星數變化
- #69
阿里巴巴開源的 Qwen-VL 系列微調開源實現。
★ 1,961+0近 7 天星數變化 - #70★ 1,946+0近 7 天星數變化
- #71
朝向先進文學機器(Advanced Literate Machinery)的原創創新點子與演算法集合。本專案由阿里巴巴集團通義實驗室語言技術實驗室 OCR 團隊維護。
★ 1,835+0近 7 天星數變化 - #72★ 1,818+0近 7 天星數變化
- #73
為你的應用程式打造的自我編碼系統 — 適用於 Android 的 Alan AI SDK
★ 1,807+0近 7 天星數變化 - #74
應用程式的自我編碼系統 — 用於 Flutter 的 Alan AI SDK
★ 1,756+0近 7 天星數變化 - #75
應用程式的自我編碼系統 — 適用於 Ionic 的 Alan AI SDK
★ 1,649+0近 7 天星數變化 - #76
用於 AI 資料應用的統一多模態後端
★ 1,619+0近 7 天星數變化 - #77★ 1,602+0近 7 天星數變化
- #78★ 1,524+0近 7 天星數變化
- #79★ 1,514+0近 7 天星數變化
- #80
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,468+380近 7 天星數變化 - #81
你家的視覺智慧。
★ 1,454+0近 7 天星數變化 - #82
日本語LLM總結 - 日本語LLM概覽
★ 1,428+0近 7 天星數變化 - #83★ 1,406+0近 7 天星數變化
- #84★ 1,314+0近 7 天星數變化
- #85
包含 155 種以上 VLM/MLLM 架構的精選視覺化目錄:包含論文、圖表、訓練配方、資料集,以及多模態 AI 代理的發布時間軸。
★ 1,310+0近 7 天星數變化 - #86
賦予 Claude 觀看與理解影片的能力 — 具有影格擷取與多模態語音分析的 Claude Code 外掛程式
★ 1,281+0近 7 天星數變化 - #87★ 1,247+0近 7 天星數變化
- #88★ 1,239+0近 7 天星數變化
- #89
結合語言模型統一 3D 網格生成
★ 1,167+0近 7 天星數變化 - #90★ 1,153+0近 7 天星數變化