跳到主要內容
buildradar
Sign in
主題 · multi-modal

multi-modal

標記 multi-modal 主題、收錄中的開源專案,依星數排序。

共 42 個專案
  • VisRAG@OpenBMB

    由 VLM 支援的無解析 RAG

    979-1近 7 天星數變化
  • farmvibes-ai@microsoft

    FarmVibes.AI:用於農業與永續發展的多模態地理空間 ML 模型

    895+0近 7 天星數變化
  • LanguageBind@PKU-YuanGroup

    【ICLR 2024🔥】透過基於語言的語意對齊將視訊語言預訓練擴展至 N 模態

    885+0近 7 天星數變化
  • byaldi@AnswerDotAI

    只需幾行程式碼即可使用 ColPali 等後期互動多模態模型

    852+0近 7 天星數變化
  • OmniLottie@OpenVGLab

    [CVPR 2026🔥] 🧑‍🎨 OmniLottie,一個開源的多模態指令式向量動畫生成器,可輸出 Lottie JSON。

    775+3近 7 天星數變化
  • Versatile-OCR-Program@raphael-seo

    針對 ML 訓練最佳化的多模態 OCR 管線(文字、圖形、數學、表格、圖表)

    675+0近 7 天星數變化
  • UniControl@salesforce

    統一的可控視覺生成模型

    662+0近 7 天星數變化
  • Aether@InternRobotics

    [ICCV 2025 & ICCV 2025 RIWM 傑出論文] Aether:幾何感知統一世界模型。

    609+0近 7 天星數變化
  • RT-2@kyegomez

    RT-2 的民主化,「RT-2:將視覺與語言轉化為行動的新模型」。

    583-1近 7 天星數變化
  • fashion-clip@patrickjohncyh

    FashionCLIP 是一個針對時尚領域微調的類 CLIP 模型。

    537+3近 7 天星數變化
  • forge-film@F-R-L

    基於 DAG 的多模型平行 AI 影視生成引擎。平行加速隨場景獨立性擴展;同時生成影視場景而非逐一生成;將影視生成的執行圖從拓撲序轉為關鍵路徑最佳排程;唯一將場景敘事依賴建模為 DAG 並以 CPM 演算法驅動平行排程的影視生成引擎。

    536+0近 7 天星數變化
  • Robust-R1@jqtangust

    🔥🔥🔥[AAAI 2026 Oral] Robust-R1 官方實作:用於穩健視覺理解的降級感知推理

    511+0近 7 天星數變化
← 返回主題列表