OpenGVLab
Repositori open source terpantau milik OpenGVLab, diurutkan berdasarkan bintang.
- #1
[CVPR 2024 Oral] Keluarga InternVL: Alternatif Open-Source Perintis untuk GPT-4o. Model dialog multimodal open-source dengan performa mendekati GPT-4o
★ 10.147+6Perubahan bintang dalam 7 hari terakhir - #2
[ICLR 2024] Fine-tuning LLaMA untuk mengikuti instruksi dalam waktu 1 jam dan 1,2 juta parameter
★ 5.914+0Perubahan bintang dalam 7 hari terakhir - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT dengan pemahaman video! Dan banyak lagi LM yang didukung seperti miniGPT4, StableLM, dan MOSS.
★ 3.347+0Perubahan bintang dalam 7 hari terakhir - #4
InternGPT (iGPT) adalah platform demo open source untuk memamerkan model AI Anda dengan mudah. Kini mendukung DragGAN, ChatGPT, ImageBind, obrolan multimodal seperti GPT-4, SAM, penyuntingan gambar interaktif, dll. Coba di igpt.opengvlab.com.
★ 3.205+1Perubahan bintang dalam 7 hari terakhir - #5
[CVPR 2023 Highlight] InternImage: Menjelajahi Model Fondasi Visi Skala Besar dengan Deformable Convolutions.
★ 2.841+2Perubahan bintang dalam 7 hari terakhir - #6
[ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal
★ 2.370+4Perubahan bintang dalam 7 hari terakhir - #7★ 1.154+1Perubahan bintang dalam 7 hari terakhir
- #8★ 1.134+1Perubahan bintang dalam 7 hari terakhir
- #9
[ICLR 2026 Oral] ScaleCUA adalah agen penggunaan komputer sumber terbuka yang dapat beroperasi pada lingkungan lintas platform (Windows, macOS, Ubuntu, Android).
★ 1.133+3Perubahan bintang dalam 7 hari terakhir - #10
[ECCV2024] VideoMamba: State Space Model untuk Pemahaman Video yang Efisien
★ 1.125+1Perubahan bintang dalam 7 hari terakhir - #11
[ICLR2024 spotlight] OmniQuant adalah teknik kuantisasi yang sederhana dan kuat untuk LLM.
★ 911+3Perubahan bintang dalam 7 hari terakhir - #12
[CVPR 2023] VideoMAE V2: Penskalaan Video Masked Autoencoders dengan Dual Masking
★ 816+2Perubahan bintang dalam 7 hari terakhir - #13★ 746+0Perubahan bintang dalam 7 hari terakhir
- #14
Chatbot Arena bertemu dengan multimodalitas! Multi-Modality Arena memungkinkan Anda membandingkan model visi-bahasa secara berdampingan sambil menyediakan gambar sebagai masukan. Mendukung MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2, dan banyak lagi!
★ 566+0Perubahan bintang dalam 7 hari terakhir - #15
[ICLR 2025 Spotlight] Vision-RWKV: Persepsi Visual yang Efisien dan Skalabel dengan Arsitektur Mirip RWKV
★ 556+0Perubahan bintang dalam 7 hari terakhir - #16
[ICLR2026] VideoChat-Flash: Kompresi Hierarkis untuk Pemodelan Video Konteks Panjang
★ 528+0Perubahan bintang dalam 7 hari terakhir - #17
[ICLR 2024 & ECCV 2024] Proyek The All-Seeing: Menuju Pengenalan & Pemahaman Visual Panoptik serta Pemahaman Hubungan Umum di Dunia Terbuka
★ 506+0Perubahan bintang dalam 7 hari terakhir