跳到主要內容
buildradar
登入
主題 · multimodal

multimodal

標記 multimodal 主題、收錄中的開源專案,依星數排序。

共 148 個專案
  • stability-sdk@Stability-AI

    用於與 stability.ai API 互動的 SDK(例如 stable diffusion 推論)。

    2,435+0近 7 天星數變化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用於文件理解的模組化多模態大型語言模型

    2,411+0近 7 天星數變化
  • InternVideo@OpenGVLab

    [ECCV2024] 用於多模態理解的影片基礎模型與資料

    2,374+0近 7 天星數變化
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer:從頭開始或從種子資料生成高品質的合成資料。

    2,197+0近 7 天星數變化
  • genai-processors@google-gemini

    GenAI Processors 是一個輕量級的 Python 程式庫,可實現高效、平行的內容處理。

    2,120+0近 7 天星數變化
  • claude-real-video@HUANGCHIHHUNGLeo

    讓 Claude(或任何 LLM)真正觀看影片——支援從網址或本地檔案取得具場景感知、去除重複影格與逐字稿的功能。本機執行,採用 MIT 授權。

    2,109+0近 7 天星數變化
  • parlor@fikrikarim

    具備類似 GPT-Live 功能的裝置端即時多模態 AI

    2,048+0近 7 天星數變化
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Show-o 系列儲存庫,統一多模態理解與生成的單一 Transformer。

    1,975+0近 7 天星數變化
  • 阿里巴巴開源的 Qwen-VL 系列微調開源實現。

    1,961+0近 7 天星數變化
  • BitNet@kyegomez

    在 pytorch 中實作「BitNet: Scaling 1-bit Transformers for Large Language Models」

    1,946+0近 7 天星數變化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向先進文學機器(Advanced Literate Machinery)的原創創新點子與演算法集合。本專案由阿里巴巴集團通義實驗室語言技術實驗室 OCR 團隊維護。

    1,835+0近 7 天星數變化
  • DeTikZify@potamides

    使用 TikZ 為科學圖表和草圖合成繪圖程式。

    1,818+0近 7 天星數變化
  • 為你的應用程式打造的自我編碼系統 — 適用於 Android 的 Alan AI SDK

    1,807+0近 7 天星數變化
  • 應用程式的自我編碼系統 — 用於 Flutter 的 Alan AI SDK

    1,756+0近 7 天星數變化
  • alan-sdk-ionic@alan-ai

    應用程式的自我編碼系統 — 適用於 Ionic 的 Alan AI SDK

    1,649+0近 7 天星數變化
  • pixeltable@pixeltable

    用於 AI 資料應用的統一多模態後端

    1,619+0近 7 天星數變化
  • mllm@UbiquitousLearning

    行動裝置上的快速多模態 LLM

    1,602+0近 7 天星數變化
  • thepipe@emcf

    藉由視覺語言模型(VLM),從複雜的文件中取得乾淨的資料 ⚡

    1,524+0近 7 天星數變化
  • Ovis@ATH-MaaS

    一種新穎的多模態大型語言模型(MLLM)架構,旨在結構化對齊視覺與文字嵌入。

    1,514+0近 7 天星數變化
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,468+380近 7 天星數變化
  • ha-llmvision@valentinfrlch

    你家的視覺智慧。

    1,454+0近 7 天星數變化
  • awesome-japanese-llm@llm-jp

    日本語LLM總結 - 日本語LLM概覽

    1,428+0近 7 天星數變化
  • SDT@dailenson

    此儲存庫是手寫生成中分離書寫者與字元風格(CVPR 2023)的官方實作

    1,406+0近 7 天星數變化
  • airunner@Capsize-Games

    用於藝術、即時語音對話、LLM 驅動的聊天機器人與自動化工作流程的離線推論引擎

    1,314+0近 7 天星數變化
  • 包含 155 種以上 VLM/MLLM 架構的精選視覺化目錄:包含論文、圖表、訓練配方、資料集,以及多模態 AI 代理的發布時間軸。

    1,310+0近 7 天星數變化
  • claude-video-vision@jordanrendric

    賦予 Claude 觀看與理解影片的能力 — 具有影格擷取與多模態語音分析的 Claude Code 外掛程式

    1,281+0近 7 天星數變化
  • UForm@unum-cloud

    袖珍型多模態 AI,用於跨多語言文字、圖片和影片的內容理解與生成,速度比 OpenAI CLIP 和 LLaVA 快達 5 倍

    1,247+0近 7 天星數變化
  • xtreme1@xtreme1-io

    Xtreme1 是一個用於多模態資料訓練的整合式資料標註與註解平台,支援 3D LiDAR 點雲、影像和 LLM。

    1,239+0近 7 天星數變化
  • LLaMA-Mesh@nv-tlabs

    結合語言模型統一 3D 網格生成

    1,167+0近 7 天星數變化
  • doc7@magicrew

    透過視覺理解將文件轉換為具備 AI 處理能力的 Markdown

    1,153+0近 7 天星數變化
← 返回主題列表