OpenGVLab
Erfasste Open-Source-Repos von OpenGVLab, sortiert nach Sternen.
- #1
[CVPR 2024 Oral] InternVL Family: Eine bahnbrechende Open-Source-Alternative zu GPT-4o. Ein Open-Source-Multimodal-Dialogmodell, das der Leistung von GPT-4o nahekommt.
★ 10.147+6Sterne-Änderung der letzten 7 Tage - #2
[ICLR 2024] Fine-Tuning von LLaMA zum Befolgen von Anweisungen innerhalb von 1 Stunde und mit 1,2M Parametern
★ 5.914+0Sterne-Änderung der letzten 7 Tage - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT mit Videoverständnis! Sowie viele weitere unterstützte LMs wie miniGPT4, StableLM und MOSS.
★ 3.347+0Sterne-Änderung der letzten 7 Tage - #4
InternGPT (iGPT) ist eine Open-Source-Demoplattform zur einfachen Präsentation von KI-Modellen. Unterstützt nun DragGAN, ChatGPT, ImageBind, multimodalen Chat wie GPT-4, SAM, interaktive Bildbearbeitung und mehr. Testen Sie es unter igpt.opengvlab.com
★ 3.205+1Sterne-Änderung der letzten 7 Tage - #5
[CVPR 2023 Highlight] InternImage: Untersuchung groß angelegter Vision Foundation Models mit deformierbaren Faltungen
★ 2.841+2Sterne-Änderung der letzten 7 Tage - #6
[ECCV2024] Video Foundation Models & Data für multimodales Verständnis
★ 2.370+4Sterne-Änderung der letzten 7 Tage - #7★ 1.154+1Sterne-Änderung der letzten 7 Tage
- #8★ 1.134+1Sterne-Änderung der letzten 7 Tage
- #9
[ICLR 2026 Oral] ScaleCUA ist ein Open-Source-Agent für Computernutzung, der in plattformübergreifenden Umgebungen (Windows, macOS, Ubuntu, Android) arbeiten kann.
★ 1.133+3Sterne-Änderung der letzten 7 Tage - #10
[ECCV2024] VideoMamba: State-Space-Modell für effizientes Videoverständnis
★ 1.125+1Sterne-Änderung der letzten 7 Tage - #11
[ICLR2024 Spotlight] OmniQuant ist eine einfache und leistungsstarke Quantisierungstechnik für LLMs.
★ 911+3Sterne-Änderung der letzten 7 Tage - #12
[CVPR 2023] VideoMAE V2: Skalierung von Video Masked Autoencoders mit Dual Masking
★ 816+2Sterne-Änderung der letzten 7 Tage - #13★ 746+0Sterne-Änderung der letzten 7 Tage
- #14
Chatbot Arena trifft auf Multimodalität! Multi-Modality Arena ermöglicht es, Vision-Language-Modelle nebeneinander zu benchmarken, während Bilder als Eingaben bereitgestellt werden. Unterstützt MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 und viele weitere!
★ 566+0Sterne-Änderung der letzten 7 Tage - #15
[ICLR 2025 Spotlight] Vision-RWKV: Effiziente und skalierbare visuelle Wahrnehmung mit RWKV-basierten Architekturen
★ 556+0Sterne-Änderung der letzten 7 Tage - #16
[ICLR2026] VideoChat-Flash: Hierarchische Kompression für die Modellierung langer Videokontexte.
★ 528+0Sterne-Änderung der letzten 7 Tage - #17
[ICLR 2024 & ECCV 2024] The All-Seeing Projects: Panoptische visuelle Erkennung, Verständnis und allgemeines Beziehungsverständnis in der offenen Welt.
★ 506+0Sterne-Änderung der letzten 7 Tage