OpenGVLab
OpenGVLab 收录中的开源项目,按星标数排序。
- #1★ 10,150+3近 7 天星标变化
- #2
[ICLR 2024] 在 1 小时内微调 LLaMA 以遵循指令,仅需 1.2M 参数
★ 5,915+1近 7 天星标变化 - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT 具备视频理解功能!并支持 miniGPT4、StableLM、MOSS 等多种语言模型
★ 3,347+0近 7 天星标变化 - #4
InternGPT (iGPT) 是一个开源演示平台,您可以轻松展示 AI 模型。现在支持 DragGAN、ChatGPT、ImageBind、多模态聊天如 GPT-4、SAM、互动图像编辑等。试试 igpt.opengvlab.com(支持 DragGAN、ChatGPT、ImageBind、SAM 的线上 Demo 系统)
★ 3,205+0近 7 天星标变化 - #5
[CVPR 2023 Highlight] InternImage:利用可变形卷积探索大规模视觉基础模型
★ 2,845+4近 7 天星标变化 - #6
[ECCV2024] 用于多模态理解的视频基础模型与数据
★ 2,374+5近 7 天星标变化 - #7★ 1,154+0近 7 天星标变化
- #8★ 1,134+0近 7 天星标变化
- #9★ 1,133+0近 7 天星标变化
- #10
[ECCV2024] VideoMamba: 用于高效视频理解的状态空间模型
★ 1,125+0近 7 天星标变化 - #11★ 919+9近 7 天星标变化
- #12
[CVPR 2023] VideoMAE V2: 通过双重遮罩扩展 Video Masked Autoencoders
★ 819+3近 7 天星标变化 - #13★ 746+0近 7 天星标变化
- #14
Chatbot Arena 遇上多模态!Multi-Modality Arena 允许您在输入图像的同时,并排评测视觉语言模型。支持 MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2 等多种模型!
★ 566+0近 7 天星标变化 - #15
[ICLR 2025 Spotlight] Vision-RWKV:基于 RWKV 架构的高效且可扩展视觉感知模型
★ 556+0近 7 天星标变化 - #16
[ICLR2026] VideoChat-Flash:用于长文本视频建模的层级压缩技术
★ 529+1近 7 天星标变化 - #17
[ICLR 2024 & ECCV 2024] The All-Seeing 项目:迈向开放世界的全景视觉识别与理解及通用关系理解。
★ 506+0近 7 天星标变化