multimodal-large-language-models
标记 multimodal-large-language-models 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 multimodal-large-language-models 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 multimodal-large-language-models 主题的项目。
- #1
✨✨最新的多模态大型语言模型进展
★ 17,996+0近 7 天星标变化 - #2
Mobile-Agent:功能强大的 GUI 代理系列
★ 9,157+0近 7 天星标变化 - #3
StarVector 是一个将向量化转化为代码生成任务的 SVG 基础模型。它使用视觉-语言建模架构,处理视觉与文字输入,产生高质量 SVG 代码,精度卓越
★ 4,567+0近 7 天星标变化 - #4
LLaMA-Omni 是一個基於 Llama-3.1-8B-Instruct 構建的低延遲、高質量端到端語音交互模型,旨在達到 GPT-4o 級別的語音能力。
★ 3,147+0近 7 天星标变化 - #5★ 2,933+0近 7 天星标变化
- #6★ 2,532+0近 7 天星标变化
- #7
mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型
★ 2,411+0近 7 天星标变化 - #8★ 2,014+0近 7 天星标变化
- #9
[ICML 2024] 掌握文本到图像扩散模型:利用多模态 LLM 进行重新标注、规划与生成(RPG)
★ 1,844+0近 7 天星标变化 - #10
Seed1.5-VL 是一个视觉-语言基础模型,旨在推进通用多模态理解与推理,在 60 个公开基准测试中的 38 个达到顶尖性能。
★ 1,586+0近 7 天星标变化 - #11★ 1,514+0近 7 天星标变化
- #12
精选的统一多模态模型列表
★ 1,314+0近 7 天星标变化 - #13★ 1,303+0近 7 天星标变化
- #14
Audio Flamingo 的 PyTorch 实现:一系列先进的音频理解语言模型
★ 1,184+0近 7 天星标变化 - #15★ 1,058+1近 7 天星标变化
- #16★ 1,052-1近 7 天星标变化
- #17
多模态思维链推理:综合调查
★ 1,025+1近 7 天星标变化 - #18
多模态学习在医学影像应用之资源集合。
★ 975+0近 7 天星标变化 - #19★ 890+2近 7 天星标变化
- #20★ 791+0近 7 天星标变化
- #21
LLaVA-Plus:能外挂并学习使用技能的大型语言与视觉助手。
★ 769-1近 7 天星标变化 - #22★ 706+0近 7 天星标变化
- #23★ 702+0近 7 天星标变化
- #24
个人项目:MPP-Qwen14B & MPP-Qwen-Next(基于 Qwen-LM 的多模态流水线并行)。支持 [视频/图像/多图] {SFT/对话}。不要让贫穷限制您的想象力!在 RTX3090/4090 24GB 上训练您自己的 8B/14B LLaVA 风格 MLLM。
★ 687+1近 7 天星标变化 - #25★ 679+1近 7 天星标变化
- #26
✨✨Woodpecker: 多模态大型语言模型的幻觉修正
★ 650+1近 7 天星标变化 - #27★ 640+0近 7 天星标变化
- #28★ 577+1近 7 天星标变化
- #29
LLaVA-Mini 是一个统一的大型多模态模型 (LMM),能以高效方式支持图像、高分辨率图像及视频的理解。
★ 577+0近 7 天星标变化 - #30
Cambrian-S:迈向影片中的空间超感知
★ 567-1近 7 天星标变化