跳到主要內容
buildradar
登入
主題 · multimodal

multimodal

標記 multimodal 主題、收錄中的開源專案,依星數排序。

共 148 個專案
  • 為純文字模型「看圖」設計更好的視覺工具箱和技能,支援多圖理解、圖片問答、前端UI還原、GUI 自動化等,並可選無縫接入多個主流agent,直接識別貼上圖片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

    1,136+0近 7 天星數變化
  • 應用程式的自我編碼系統 — 適用於 Cordova 的 Alan AI SDK

    1,132+0近 7 天星數變化
  • sglang-omni@sgl-project

    SGLang-Omni 為 TTS、ASR、語音與全能模型提供高效能服務。

    1,118+56近 7 天星數變化
  • MOVA@OpenMOSS

    MOVA:邁向可擴充且同步的視訊-音訊生成

    1,110+2近 7 天星數變化
  • dsh-vision-router@ysr666

    專為純文字 DeepSeek Harness 代理設計的靈視工具:內建免費視覺鏈(無需金鑰)與像素級視覺工具(問答、定位、裁切、像素差異、顏色、OCR、SVG 描摹、去背、截圖)。一鍵安裝,無需 Python,圖片處理就像一般的工具呼叫一樣自然。

    1,097+45近 7 天星數變化
  • Aria@rhymes-ai

    Aria 的程式碼庫 - 一個開源的多模態原生 MoE

    1,088+1近 7 天星數變化
  • XrayGLM@WangRongsheng

    🩺 首個會看胸部 X 光片的中文多模態醫學大模型 | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.

    1,085+2近 7 天星數變化
  • VisCPM@OpenBMB

    [ICLR'24 spotlight] 中英雙語多模態大模型系列(對話與繪圖)| 基於 CPM 基礎模型的中英雙語多模態大模型系列

    1,061-1近 7 天星數變化
  • ONE-PEACE@OFA-Sys

    跨視覺、音訊、語言模態的通用表示模型。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0近 7 天星數變化
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM:賦能大型語言模型理解點雲

    1,054+2近 7 天星數變化
  • CLIP4Clip@ArrowLuo

    「CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval」的官方實作

    1,033+2近 7 天星數變化
  • Awesome-MCoT@yaotingwangofficial

    多模態思維鏈推理:綜合調查

    1,025+1近 7 天星數變化
  • tongflow@tong-io

    TongFlow — 多模態 GenAI 工作室

    1,018+8近 7 天星數變化
  • verl-omni@verl-project

    針對擴散與全能模型的多模態 RL 訓練框架

    983+49近 7 天星數變化
  • vectordb-recipes@lancedb

    結合向量搜尋與 LLM 的多模態 AI、RAG 與 Agent 資源、範例與教學

    973+0近 7 天星數變化
  • rag-time@microsoft

    RAG Time:掌握 RAG 的 5 週學習之旅

    902+1近 7 天星數變化
  • 這個儲存庫精選了 CVPR 2025 最令人興奮且最具影響力的論文。🔥 [論文 + 程式碼 + 展示]

    895+1近 7 天星數變化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:從第一性原理構建的原生視覺語言模型

    890+2近 7 天星數變化
  • AnyGPT@OpenMOSS

    「AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling」的程式碼

    881-1近 7 天星數變化
  • ohmycaptcha@shenhao-stu

    ⚡ 使用 FastAPI、Playwright 與相容 OpenAI 的多模態模型建構的自我主機、相容 YesCaptcha 的驗證碼破解工具。

    870+1近 7 天星數變化
  • lmms-engine@EvolvingLMMs-Lab

    一個簡單、統一的多模態模型訓練引擎。精簡、靈活,專為大規模修改與實驗打造。

    825+1近 7 天星數變化
  • [TMLR 2025🔥] 視覺自迴歸模型總覽。

    808+0近 7 天星數變化
  • papermage@allenai

    支援科學論文 NLP 與 CV 研究的程式庫

    803+0近 7 天星數變化
  • contrastors@nomic-ai

    在 PyTorch 中進行對比模型訓練

    802+0近 7 天星數變化
  • 本機監控 + AI 視覺 — 基於區域網路、由智慧型手機驅動的 AI 監控框架,提供用於資料擷取與分析的結構化事件輸出。

    772+11近 7 天星數變化
  • 多模態與大型語言模型論文列表,僅用於記錄個人日常在 arXiv 上閱讀的論文。

    761+0近 7 天星數變化
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR:遵循人類指令的高品質影像還原 https://huggingface.co/spaces/marcosv/InstructIR

    742+1近 7 天星數變化
  • PaddleMIX@PaddlePaddle

    Paddle 多模態整合與探索,支援主流多模態任務,包含端到端大型多模態預訓練模型與擴散模型工具箱。具備高效能與靈活性。

    723-1近 7 天星數變化
  • MMRec@enoche

    多模態推薦工具箱。整合 10+ 個模型...

    690+2近 7 天星數變化
  • VLM2Vec@TIGER-AI-Lab

    此儲存庫包含「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026] 以及「MMEB-V3」[COLM 2026] 的程式碼

    683+2近 7 天星數變化
← 返回主題列表