multimodal
标记 multimodal 主题、收录中的开源项目,按星标数排序。
- #61
用于与 stability.ai API 交互的 SDK(例如 stable diffusion 推理)。
★ 2,435+0近 7 天星标变化 - #62
mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型
★ 2,411+0近 7 天星标变化 - #63
[ECCV2024] 用于多模态理解的视频基础模型与数据
★ 2,374+0近 7 天星标变化 - #64
🎨 NeMo Data Designer:从头开始或从种子数据生成高质量的合成数据。
★ 2,197+0近 7 天星标变化 - #65
GenAI Processors 是一个轻量级的 Python 库,可实现高效、并行的内容处理。
★ 2,120+0近 7 天星标变化 - #66
让 Claude(或任何 LLM)真正观看视频——支持从网址或本地文件获取具场景感知、去除重复帧与文字记录的功能。本地运行,采用 MIT 授权。
★ 2,109+0近 7 天星标变化 - #67★ 2,048+0近 7 天星标变化
- #68★ 1,975+0近 7 天星标变化
- #69
阿里巴巴开源的 Qwen-VL 系列微调开源实现。
★ 1,961+0近 7 天星标变化 - #70★ 1,946+0近 7 天星标变化
- #71
朝向高级文学机器(Advanced Literate Machinery)的原创创新点子与算法集合。本项目由阿里巴巴集团通义实验室语言技术实验室 OCR 团队维护。
★ 1,835+0近 7 天星标变化 - #72★ 1,818+0近 7 天星标变化
- #73
为你的应用程序打造的自我编码系统 — 适用于 Android 的 Alan AI SDK
★ 1,807+0近 7 天星标变化 - #74
应用程序的自我编码系统 — 用于 Flutter 的 Alan AI SDK
★ 1,756+0近 7 天星标变化 - #75
应用程序的自我编码系统 — 适用于 Ionic 的 Alan AI SDK
★ 1,649+0近 7 天星标变化 - #76
用于 AI 数据应用的统一多模态后端
★ 1,619+0近 7 天星标变化 - #77★ 1,602+0近 7 天星标变化
- #78★ 1,524+0近 7 天星标变化
- #79★ 1,514+0近 7 天星标变化
- #80
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,468+380近 7 天星标变化 - #81
你家的视觉智能。
★ 1,454+0近 7 天星标变化 - #82
日本語LLM总结 - 日本语LLM概览
★ 1,428+0近 7 天星标变化 - #83★ 1,406+0近 7 天星标变化
- #84★ 1,314+0近 7 天星标变化
- #85
包含 155 种以上 VLM/MLLM 架构的精选视觉化目录:包含论文、图表、训练配方、数据集,以及多模态 AI 代理的发布时间轴。
★ 1,310+0近 7 天星标变化 - #86
赋予 Claude 观看与理解视频的能力 — 具有帧提取与多模态语音分析的 Claude Code 外挂程序
★ 1,281+0近 7 天星标变化 - #87★ 1,247+0近 7 天星标变化
- #88★ 1,239+0近 7 天星标变化
- #89
结合语言模型统一 3D 网格生成
★ 1,167+0近 7 天星标变化 - #90★ 1,153+0近 7 天星标变化