跳到主要內容
buildradar
登入
主題 · multimodal

multimodal

標記 multimodal 主題、收錄中的開源專案,依星數排序。

共 148 個專案
  • MOSS-Audio@OpenMOSS

    MOSS-Audio 是一個用於統一語音理解的開源基礎模型,在真實世界場景中支援語音、聲音、音樂、標題生成、問答與推理。

    658+4近 7 天星數變化
  • ✨✨基礎模型推理最新論文與基準測試

    657+1近 7 天星數變化
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) 官方實作。

    641-1近 7 天星數變化
  • Seg-Zero@JIA-Lab-research

    「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」專案頁面

    640+1近 7 天星數變化
  • 👁️ + 💬 + 🎧 = 🤖 精選頂級基礎與多模態模型列表![論文 + 程式碼 + 範例 + 教學]

    637+0近 7 天星數變化
  • second-brain@henrydaum

    Second Brain 是一個代理型框架,作為作業系統運作,利用本地檔案智慧、工作流程自動化與 LLMs 來完成任務,並透過多種模態與訊息平台進行通訊。

    634+14近 7 天星數變化
  • blended-latent-diffusion@omriav

    「Blended Latent Diffusion」[SIGGRAPH 2023] 的官方實作

    632+0近 7 天星數變化
  • RAG-Driven-Generative-AI@Denis2054

    此儲存庫提供程式碼,利用 LlamaIndex、Deep Lake 和 Pinecone 建立 Generative AI 的檢索增強生成(RAG)程式碼,並運用 OpenAI 與 Hugging Face 模型進行生成與評估。

    624+2近 7 天星數變化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模態「Aha 時刻」

    623+0近 7 天星數變化
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni:用於 3D 資產可控生成的統一框架

    621+7近 7 天星數變化
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    620+88近 7 天星數變化
  • tokenize-anything@baaivision

    [ECCV 2024] 透過提示詞實現任意標記化

    600+0近 7 天星數變化
  • Relax@redai-studio

    用於大規模全模態後訓練的非同步強化學習引擎。

    598+13近 7 天星數變化
  • MMMU@MMMU-Benchmark

    此儲存庫包含論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」的評估程式碼

    594+1近 7 天星數變化
  • blended-diffusion@omriav

    「Blended Diffusion for Text-driven Editing of Natural Images」官方實作 [CVPR 2022]

    588-1近 7 天星數變化
  • rai@RobotecAI

    RAI 是一個用於物理 AI 機器人的供應商無關代理框架,利用 ROS 2 工具執行複雜動作、定義場景、自由介面執行、日誌摘要、語音互動等。

    587+11近 7 天星數變化
  • AI-Employe@vignshwarar

    使用 GPT-4 Vision 像教導人類一樣建立瀏覽器自動化。

    586+1近 7 天星數變化
  • Groma@FoundationVision

    [ECCV2024] 具備局部視覺標記化功能的接地多模態大型語言模型

    586+0近 7 天星數變化
  • motis@motis-project

    多模式路由、地理編碼與地圖圖磚

    579+3近 7 天星數變化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一個統一的大型多模態模型 (LMM),能以高效方式支援圖像、高解析度圖像及影片的理解。

    577+0近 7 天星數變化
  • multimodal-agents-course@the-ai-merge

    一個具備視覺與聽覺的 MCP 多模態 AI 代理!

    575-1近 7 天星數變化
  • 您的應用程式自動編碼系統 — 用於 React Native 的 Alan AI SDK

    575+0近 7 天星數變化
  • psi@microsoft

    情境智慧平台

    572+0近 7 天星數變化
  • clip.cpp@monatis

    純 C/C++ 的 CLIP 推論,無額外依賴。

    568+0近 7 天星數變化
  • Flame-Code-VLM@Flame-Code-VLM

    Flame 是一個開源的多模態 AI 系統,旨在將 UI 設計稿轉換為高品質的 React 程式碼。它利用視覺語言模型、自動化資料合成與結構化訓練工作流程,縮短設計與前端開發之間的差距。

    562+0近 7 天星數變化
  • vlmrun-hub@vlm-run

    供 VLM 使用的各類產業特定架構中心。

    556+1近 7 天星數變化
  • 精選多模態建模資源 [涵蓋 MLLM、UMM 與 NMM]

    544+1近 7 天星數變化
  • EVF-SAM@hustvl

    「EVF-SAM:用於文字提示分割一切模型的早期視覺語言融合」官方程式碼

    508+0近 7 天星數變化
← 返回主題列表