跳到主要内容
buildradar
登录
主题 · multimodal

multimodal

标记 multimodal 主题、收录中的开源项目,按星标数排序。

共 148 个项目
  • MOSS-Audio@OpenMOSS

    MOSS-Audio 是一个用于统一音频理解的开源基础模型,在真实世界场景中支持语音、声音、音乐、标题生成、问答与推理。

    658+4近 7 天星标变化
  • ✨✨基础模型推理最新论文与基准测试

    657+1近 7 天星标变化
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) 官方实现。

    641-1近 7 天星标变化
  • Seg-Zero@JIA-Lab-research

    “Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement”项目页面

    640+1近 7 天星标变化
  • 👁️ + 💬 + 🎧 = 🤖 精选顶级基础与多模态模型列表![论文 + 代码 + 示例 + 教程]

    637+0近 7 天星标变化
  • second-brain@henrydaum

    Second Brain 是一个代理型框架,作为操作系统运作,利用本地文件智能、工作流程自动化与 LLMs 来完成任务,并透过多种模态与消息平台进行通讯。

    634+14近 7 天星标变化
  • blended-latent-diffusion@omriav

    「Blended Latent Diffusion」[SIGGRAPH 2023] 的官方实现

    632+0近 7 天星标变化
  • RAG-Driven-Generative-AI@Denis2054

    此存储库提供程序代码,利用 LlamaIndex、Deep Lake 和 Pinecone 建立 Generative AI 的检索增强生成(RAG)代码,并运用 OpenAI 与 Hugging Face 模型进行生成与评估。

    624+2近 7 天星标变化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模态“Aha 时刻”

    623+0近 7 天星标变化
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni:用于 3D 资产可控生成的统一框架

    621+7近 7 天星标变化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    620+88近 7 天星标变化
  • tokenize-anything@baaivision

    [ECCV 2024] 通过提示词实现任意标记化

    600+0近 7 天星标变化
  • Relax@redai-studio

    用于大规模全模态后训练的异步强化学习引擎。

    598+13近 7 天星标变化
  • MMMU@MMMU-Benchmark

    此仓库包含论文“MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI”的评估代码

    594+1近 7 天星标变化
  • blended-diffusion@omriav

    “Blended Diffusion for Text-driven Editing of Natural Images” 官方实现 [CVPR 2022]

    588-1近 7 天星标变化
  • rai@RobotecAI

    RAI 是一个用于物理 AI 机器人的供应商无关代理框架,利用 ROS 2 工具执行复杂动作、定义场景、自由接口执行、日志摘要、语音交互等。

    587+11近 7 天星标变化
  • AI-Employe@vignshwarar

    使用 GPT-4 Vision 像教导人类一样建立浏览器自动化。

    586+1近 7 天星标变化
  • Groma@FoundationVision

    [ECCV2024] 具备局部视觉标记化功能的接地多模态大型语言模型

    586+0近 7 天星标变化
  • motis@motis-project

    多模式路由、地理编码与地图图砖

    579+3近 7 天星标变化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一个统一的大型多模态模型 (LMM),能以高效方式支持图像、高分辨率图像及视频的理解。

    577+0近 7 天星标变化
  • multimodal-agents-course@the-ai-merge

    一个具备视觉与听觉的 MCP 多模态 AI 代理!

    575-1近 7 天星标变化
  • 您的应用程序自动编码系统 — 用于 React Native 的 Alan AI SDK

    575+0近 7 天星标变化
  • psi@microsoft

    情境智慧平台

    572+0近 7 天星标变化
  • clip.cpp@monatis

    纯 C/C++ 的 CLIP 推理,无额外依赖。

    568+0近 7 天星标变化
  • Flame-Code-VLM@Flame-Code-VLM

    Flame 是一个开源的多模态 AI 系统,旨在将 UI 设计稿转换为高质量的 React 代码。它利用视觉语言模型、自动化数据合成与结构化训练工作流程,缩短设计与前端开发之间的差距。

    562+0近 7 天星标变化
  • vlmrun-hub@vlm-run

    供 VLM 使用的各类产业特定架构中心。

    556+1近 7 天星标变化
  • 精选多模态建模资源 [涵盖 MLLM、UMM 与 NMM]

    544+1近 7 天星标变化
  • EVF-SAM@hustvl

    “EVF-SAM:用于文字提示分割一切模型的早期视觉语言融合”官方代码

    508+0近 7 天星标变化
← 返回主题列表