跳到主要內容
buildradar
Sign in
主題 · multimodal-large-language-models

multimodal-large-language-models

標記 multimodal-large-language-models 主題、收錄中的開源專案,依星數排序。

專案數
32
總星數
66,902
平均星數
2,091
佔比
0.00%

常跟 multimodal-large-language-models 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 multimodal-large-language-models 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • ✨✨最新的多模態大型語言模型進展

    17,996+2近 7 天星數變化
  • MobileAgent@X-PLUG

    Mobile-Agent:功能強大的 GUI 代理系列

    9,157+9近 7 天星數變化
  • star-vector@joanrod

    StarVector 是一個將向量化轉化為程式碼生成任務的 SVG 基礎模型。它使用視覺-語言建模架構,處理視覺與文字輸入,產生高品質 SVG 程式碼,精度卓越

    4,567+6近 7 天星數變化
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高品質端到端語音互動模型,旨在達到 GPT-4o 級別的語音能力。

    3,147+1近 7 天星數變化
  • VideoPipe@sherlockchou86

    基於 CV 模型與 mLLM 的跨平台視頻結構化(視頻分析)框架

    2,933+0近 7 天星數變化
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5:邁向 GPT-4o 級別的即時視訊與語音互動

    2,532-1近 7 天星數變化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用於文件理解的模組化多模態大型語言模型

    2,411+0近 7 天星數變化
  • cambrian@cambrian-mllm

    Cambrian-1 是一個採用視覺中心設計的多模態 LLM 系列。

    2,014+1近 7 天星數變化
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] 掌握文字到圖像擴散模型:利用多模態 LLM 進行重新標註、規劃與生成(RPG)

    1,844+0近 7 天星數變化
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL 是一個視覺-語言基礎模型,旨在推進通用多模態理解與推理,在 60 個公開基準測試中的 38 個達到頂尖效能。

    1,586+0近 7 天星數變化
  • Ovis@ATH-MaaS

    一種新穎的多模態大型語言模型(MLLM)架構,旨在結構化對齊視覺與文字嵌入。

    1,514+2近 7 天星數變化
  • 精選的統一多模態模型清單

    1,314+1近 7 天星數變化
  • VideoChat@Henry-23

    即時互動數位人,可自訂形象與音色,支援音色複製,對話延遲低至 3 秒

    1,303-1近 7 天星數變化
  • Audio Flamingo 的 PyTorch 實現:一系列先進的音訊理解語言模型

    1,184+2近 7 天星數變化
  • SLAM-LLM@X-LANCE

    結合大型語言模型的語音、語言、音訊、音樂處理框架

    1,058+2近 7 天星數變化
  • Bunny@BAAI-DCAI

    一系列輕量級的多模態模型。

    1,053+0近 7 天星數變化
  • Awesome-MCoT@yaotingwangofficial

    多模態思維鏈推理:綜合調查

    1,025+2近 7 天星數變化
  • 多模態學習在醫學影像應用之資源集合。

    975+1近 7 天星數變化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:從第一性原理構建的原生視覺語言模型

    889+0近 7 天星數變化
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME:影片分析中首個多模態 LLM 的綜合評估基準

    791+2近 7 天星數變化
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus:能外掛並學習使用技能的大型語言與視覺助理。

    770+0近 7 天星數變化
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat:用於長影片理解的從密集 Token 到稀疏記憶體架構

    706+0近 7 天星數變化
  • unicom@deepglint

    大規模視覺表示模型

    702+0近 7 天星數變化
  • MPP-LLaVA@Coobiw

    個人專案:MPP-Qwen14B & MPP-Qwen-Next(基於 Qwen-LM 的多模態管線並行)。支援 [影片/圖片/多圖] {微調/對話}。別讓貧窮限制您的想像力!在 RTX3090/4090 24GB 上訓練您自己的 8B/14B LLaVA 風格 MLLM。

    687+0近 7 天星數變化
  • OmniVinci@NVlabs

    OmniVinci 是一個用於聯合理解視覺、語音和語言的全模態 LLM。

    678+0近 7 天星數變化
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: 多模態大型語言模型的幻覺修正

    650+1近 7 天星數變化
  • Liquid@FoundationVision

    (IJCV 接受) Liquid:具備可擴展性與統一性的多模態語言模型生成器

    640+0近 7 天星數變化
  • Vitron@SkyworkAI

    NeurIPS 2024 論文:用於理解、生成、分割與編輯的統一像素級視覺 LLM

    577+1近 7 天星數變化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一個統一的大型多模態模型 (LMM),能以高效方式支援圖像、高解析度圖像及影片的理解。

    577+0近 7 天星數變化
  • cambrian-s@cambrian-mllm

    Cambrian-S:邁向影片中的空間超感知

    567-1近 7 天星數變化
← 返回主題列表