OpenGVLab
Các kho mã nguồn mở đang theo dõi của OpenGVLab, sắp xếp theo số sao.
- #1
[CVPR 2024 Oral] Họ InternVL: Giải pháp thay thế nguồn mở tiên phong cho GPT-4o. Mô hình đối thoại đa phương thức nguồn mở có hiệu suất gần bằng GPT-4o
★ 10.147+6Thay đổi số sao trong 7 ngày qua - #2
[ICLR 2024] Tinh chỉnh LLaMA để tuân theo các hướng dẫn trong vòng 1 giờ với 1,2M tham số
★ 5.914+0Thay đổi số sao trong 7 ngày qua - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT với tính năng hiểu video! Và nhiều LM được hỗ trợ khác như miniGPT4, StableLM và MOSS.
★ 3.347+0Thay đổi số sao trong 7 ngày qua - #4
InternGPT (iGPT) là một nền tảng demo mã nguồn mở nơi bạn có thể dễ dàng trưng bày các mô hình AI của mình. Hiện hỗ trợ DragGAN, ChatGPT, ImageBind, trò chuyện đa phương thức như GPT-4, SAM, chỉnh sửa ảnh tương tác, v.v. Hãy thử tại igpt.opengvlab.com
★ 3.205+1Thay đổi số sao trong 7 ngày qua - #5
[CVPR 2023 Highlight] InternImage: Khám phá các mô hình nền tảng thị giác quy mô lớn với các tích chập biến dạng (Deformable Convolutions)
★ 2.841+2Thay đổi số sao trong 7 ngày qua - #6
[ECCV2024] Video Foundation Models & Data dành cho thấu hiểu đa phương thức
★ 2.370+4Thay đổi số sao trong 7 ngày qua - #7★ 1.154+1Thay đổi số sao trong 7 ngày qua
- #8★ 1.134+1Thay đổi số sao trong 7 ngày qua
- #9
[ICLR 2026 Oral] ScaleCUA là các agent sử dụng máy tính mã nguồn mở có thể hoạt động trên môi trường đa nền tảng (Windows, macOS, Ubuntu, Android).
★ 1.133+3Thay đổi số sao trong 7 ngày qua - #10
[ECCV2024] VideoMamba: Mô hình không gian trạng thái (State Space Model) để hiểu video hiệu quả
★ 1.125+1Thay đổi số sao trong 7 ngày qua - #11
[ICLR2024 spotlight] OmniQuant là một kỹ thuật lượng tử hóa đơn giản và mạnh mẽ dành cho LLM.
★ 911+3Thay đổi số sao trong 7 ngày qua - #12
[CVPR 2023] VideoMAE V2: Mở rộng quy mô Video Masked Autoencoders với Dual Masking.
★ 816+2Thay đổi số sao trong 7 ngày qua - #13★ 746+0Thay đổi số sao trong 7 ngày qua
- #14
Chatbot Arena kết hợp đa phương thức! Multi-Modality Arena cho phép bạn so sánh các mô hình ngôn ngữ thị giác cạnh nhau với đầu vào là hình ảnh. Hỗ trợ MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 và nhiều mô hình khác!
★ 566+0Thay đổi số sao trong 7 ngày qua - #15
[ICLR 2025 Spotlight] Vision-RWKV: Nhận diện thị giác hiệu quả và có khả năng mở rộng với kiến trúc kiểu RWKV.
★ 556+0Thay đổi số sao trong 7 ngày qua - #16
[ICLR2026] VideoChat-Flash: Nén phân cấp cho mô hình hóa video ngữ cảnh dài
★ 528+0Thay đổi số sao trong 7 ngày qua - #17
[ICLR 2024 & ECCV 2024] Dự án All-Seeing: Hướng tới nhận dạng và hiểu thị giác toàn cảnh cùng khả năng hiểu mối quan hệ tổng quát trong thế giới mở
★ 506+0Thay đổi số sao trong 7 ngày qua