multimodal
标记 multimodal 主题、收录中的开源项目,按星标数排序。
- #121
MOSS-Audio 是一个用于统一音频理解的开源基础模型,在真实世界场景中支持语音、声音、音乐、标题生成、问答与推理。
★ 658+4近 7 天星标变化 - #122
✨✨基础模型推理最新论文与基准测试
★ 657+1近 7 天星标变化 - #123★ 641-1近 7 天星标变化
- #124
“Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement”项目页面
★ 640+1近 7 天星标变化 - #125
👁️ + 💬 + 🎧 = 🤖 精选顶级基础与多模态模型列表![论文 + 代码 + 示例 + 教程]
★ 637+0近 7 天星标变化 - #126
Second Brain 是一个代理型框架,作为操作系统运作,利用本地文件智能、工作流程自动化与 LLMs 来完成任务,并透过多种模态与消息平台进行通讯。
★ 634+14近 7 天星标变化 - #127
「Blended Latent Diffusion」[SIGGRAPH 2023] 的官方实现
★ 632+0近 7 天星标变化 - #128
此存储库提供程序代码,利用 LlamaIndex、Deep Lake 和 Pinecone 建立 Generative AI 的检索增强生成(RAG)代码,并运用 OpenAI 与 Hugging Face 模型进行生成与评估。
★ 624+2近 7 天星标变化 - #129
探索 2B 模型上的多模态“Aha 时刻”
★ 623+0近 7 天星标变化 - #130
Hunyuan3D-Omni:用于 3D 资产可控生成的统一框架
★ 621+7近 7 天星标变化 - #131★ 620+88近 7 天星标变化
- #132
[ECCV 2024] 通过提示词实现任意标记化
★ 600+0近 7 天星标变化 - #133★ 598+13近 7 天星标变化
- #134
此仓库包含论文“MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI”的评估代码
★ 594+1近 7 天星标变化 - #135
“Blended Diffusion for Text-driven Editing of Natural Images” 官方实现 [CVPR 2022]
★ 588-1近 7 天星标变化 - #136★ 587+11近 7 天星标变化
- #137
使用 GPT-4 Vision 像教导人类一样建立浏览器自动化。
★ 586+1近 7 天星标变化 - #138★ 586+0近 7 天星标变化
- #139★ 579+3近 7 天星标变化
- #140
LLaVA-Mini 是一个统一的大型多模态模型 (LMM),能以高效方式支持图像、高分辨率图像及视频的理解。
★ 577+0近 7 天星标变化 - #141
一个具备视觉与听觉的 MCP 多模态 AI 代理!
★ 575-1近 7 天星标变化 - #142
您的应用程序自动编码系统 — 用于 React Native 的 Alan AI SDK
★ 575+0近 7 天星标变化 - #143★ 572+0近 7 天星标变化
- #144★ 568+0近 7 天星标变化
- #145
Flame 是一个开源的多模态 AI 系统,旨在将 UI 设计稿转换为高质量的 React 代码。它利用视觉语言模型、自动化数据合成与结构化训练工作流程,缩短设计与前端开发之间的差距。
★ 562+0近 7 天星标变化 - #146
供 VLM 使用的各类产业特定架构中心。
★ 556+1近 7 天星标变化 - #147
精选多模态建模资源 [涵盖 MLLM、UMM 与 NMM]
★ 544+1近 7 天星标变化 - #148★ 508+0近 7 天星标变化