跳到主要内容
buildradar
登录
主题 · multi-modal

multi-modal

标记 multi-modal 主题、收录中的开源项目,按星标数排序。

共 42 个项目
  • VisRAG@OpenBMB

    由 VLM 支持的无解析 RAG

    979+0近 7 天星标变化
  • farmvibes-ai@microsoft

    FarmVibes.AI:用于农业与可持续发展的多模态地理空间 ML 模型

    896+0近 7 天星标变化
  • LanguageBind@PKU-YuanGroup

    【ICLR 2024🔥】通过基于语言的语义对齐将视频语言预训练扩展至 N 模态

    885+0近 7 天星标变化
  • byaldi@AnswerDotAI

    只需几行代码即可使用 ColPali 等后期互动多模态模型

    851-1近 7 天星标变化
  • OmniLottie@OpenVGLab

    [CVPR 2026🔥] 🧑‍🎨 OmniLottie,一个开源的多模态指令式矢量动画生成器,可输出 Lottie JSON。

    777+5近 7 天星标变化
  • Versatile-OCR-Program@raphael-seo

    针对 ML 训练优化的多模态 OCR 流水线(文本、图形、数学、表格、图表)

    675-1近 7 天星标变化
  • UniControl@salesforce

    统一的可控视觉生成模型

    662+0近 7 天星标变化
  • Aether@InternRobotics

    [ICCV 2025 & ICCV 2025 RIWM 杰出论文] Aether:几何感知统一世界模型。

    609+0近 7 天星标变化
  • RT-2@kyegomez

    RT-2 的民主化,“RT-2:将视觉与语言转化为行动的新模型”。

    583-1近 7 天星标变化
  • forge-film@F-R-L

    基于 DAG 的多模型并行 AI 影视生成引擎。并行加速随场景独立性扩展;同时生成影视场景而非逐一生成;将影视生成的执行图从拓扑序转为关键路径最优调度;唯一将场景叙事依赖建模为 DAG 并以 CPM 算法驱动并行调度的影视生成引擎。

    537+2近 7 天星标变化
  • fashion-clip@patrickjohncyh

    FashionCLIP 是一个针对时尚领域微调的类 CLIP 模型。

    537+2近 7 天星标变化
  • Robust-R1@jqtangust

    🔥🔥🔥[AAAI 2026 Oral] Robust-R1 官方实现:用于稳健视觉理解的降级感知推理

    511+0近 7 天星标变化
← 返回主题列表