跳到主要内容
buildradar
登录
主题 · multimodal-large-language-models

multimodal-large-language-models

标记 multimodal-large-language-models 主题、收录中的开源项目,按星标数排序。

项目数
32
总星标数
66,902
平均星标数
2,091
占比
0.00%

常跟 multimodal-large-language-models 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 multimodal-large-language-models 主题的项目。

  • S-Space@MirroS-Lab

    S-Space: Exploring Spatial Workspace in Multimodal Models

    149
  • ✨✨最新的多模态大型语言模型进展

    17,996+0近 7 天星标变化
  • MobileAgent@X-PLUG

    Mobile-Agent:功能强大的 GUI 代理系列

    9,157+0近 7 天星标变化
  • star-vector@joanrod

    StarVector 是一个将向量化转化为代码生成任务的 SVG 基础模型。它使用视觉-语言建模架构,处理视觉与文字输入,产生高质量 SVG 代码,精度卓越

    4,567+0近 7 天星标变化
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高質量端到端語音交互模型,旨在達到 GPT-4o 級別的語音能力。

    3,147+0近 7 天星标变化
  • VideoPipe@sherlockchou86

    基于 CV 模型与 mLLM 的跨平台视频结构化(视频分析)框架

    2,933+0近 7 天星标变化
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5:迈向 GPT-4o 级别的实时视频与语音互动

    2,532+0近 7 天星标变化
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型

    2,411+0近 7 天星标变化
  • cambrian@cambrian-mllm

    Cambrian-1 是一个采用视觉中心设计的多模态 LLM 系列。

    2,014+0近 7 天星标变化
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] 掌握文本到图像扩散模型:利用多模态 LLM 进行重新标注、规划与生成(RPG)

    1,844+0近 7 天星标变化
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL 是一个视觉-语言基础模型,旨在推进通用多模态理解与推理,在 60 个公开基准测试中的 38 个达到顶尖性能。

    1,586+0近 7 天星标变化
  • Ovis@ATH-MaaS

    一种新颖的多模态大型语言模型(MLLM)架构,旨在结构化对齐视觉与文字嵌入。

    1,514+0近 7 天星标变化
  • 精选的统一多模态模型列表

    1,314+0近 7 天星标变化
  • VideoChat@Henry-23

    实时交互数字人,可自定义形象与音色,支持音色克隆,对话延迟低至 3 秒

    1,303+0近 7 天星标变化
  • Audio Flamingo 的 PyTorch 实现:一系列先进的音频理解语言模型

    1,184+0近 7 天星标变化
  • SLAM-LLM@X-LANCE

    结合大型语言模型的语音、语言、音频、音乐处理框架

    1,058+1近 7 天星标变化
  • Bunny@BAAI-DCAI

    一系列轻量级多模态模型。

    1,052-1近 7 天星标变化
  • Awesome-MCoT@yaotingwangofficial

    多模态思维链推理:综合调查

    1,025+1近 7 天星标变化
  • 多模态学习在医学影像应用之资源集合。

    975+0近 7 天星标变化
  • NEO@EvolvingLMMs-Lab

    NEO 系列:从第一性原理构建的原生视觉语言模型

    890+2近 7 天星标变化
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME:视频分析中首个多模态 LLM 的综合评估基准

    791+0近 7 天星标变化
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus:能外挂并学习使用技能的大型语言与视觉助手。

    769-1近 7 天星标变化
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat:用于长视频理解的从密集 Token 到稀疏内存架构

    706+0近 7 天星标变化
  • unicom@deepglint

    大规模视觉表示模型

    702+0近 7 天星标变化
  • MPP-LLaVA@Coobiw

    个人项目:MPP-Qwen14B & MPP-Qwen-Next(基于 Qwen-LM 的多模态流水线并行)。支持 [视频/图像/多图] {SFT/对话}。不要让贫穷限制您的想象力!在 RTX3090/4090 24GB 上训练您自己的 8B/14B LLaVA 风格 MLLM。

    687+1近 7 天星标变化
  • OmniVinci@NVlabs

    OmniVinci 是一个用于联合理解视觉、语音和语言的全模态 LLM。

    679+1近 7 天星标变化
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: 多模态大型语言模型的幻觉修正

    650+1近 7 天星标变化
  • Liquid@FoundationVision

    (IJCV 接受) Liquid:具备可扩展性与统一性的多模态语言模型生成器

    640+0近 7 天星标变化
  • Vitron@SkyworkAI

    NeurIPS 2024 论文:用于理解、生成、分割与编辑的统一像素级视觉 LLM

    577+1近 7 天星标变化
  • LLaVA-Mini@ictnlp

    LLaVA-Mini 是一个统一的大型多模态模型 (LMM),能以高效方式支持图像、高分辨率图像及视频的理解。

    577+0近 7 天星标变化
  • cambrian-s@cambrian-mllm

    Cambrian-S:迈向影片中的空间超感知

    567-1近 7 天星标变化
← 返回主题列表