OpenGVLab
Repositorios de código abierto monitorizados de OpenGVLab, ordenados por estrellas.
- #1
[CVPR 2024 Oral] Familia InternVL: una alternativa de código abierto pionera a GPT-4o. Un modelo de diálogo multimodal de código abierto con un rendimiento cercano al de GPT-4o
★ 10.147+6Variación de estrellas de los últimos 7 días - #2
[ICLR 2024] Ajuste fino de LLaMA para seguir instrucciones en menos de 1 hora y con 1.2M de parámetros
★ 5914+0Variación de estrellas de los últimos 7 días - #3
[CVPR2024 Highlight][VideoChatGPT] ¡ChatGPT con comprensión de video! Y muchos más LM compatibles como miniGPT4, StableLM y MOSS.
★ 3347+0Variación de estrellas de los últimos 7 días - #4
InternGPT (iGPT) es una plataforma de demostración de código abierto donde puedes mostrar fácilmente tus modelos de IA. Ahora es compatible con DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edición interactiva de imágenes, etc. Pruébalo en igpt.opengvlab.com
★ 3205+1Variación de estrellas de los últimos 7 días - #5
[CVPR 2023 Highlight] InternImage: Explorando modelos de visión fundamentales a gran escala con convoluciones deformables
★ 2841+2Variación de estrellas de los últimos 7 días - #6
[ECCV2024] Modelos base de video y datos para comprensión multimodal
★ 2370+4Variación de estrellas de los últimos 7 días - #7★ 1154+1Variación de estrellas de los últimos 7 días
- #8★ 1134+1Variación de estrellas de los últimos 7 días
- #9
[ICLR 2026 Oral] ScaleCUA es el agente de uso informático de código abierto capaz de operar en entornos multiplataforma (Windows, macOS, Ubuntu, Android).
★ 1133+3Variación de estrellas de los últimos 7 días - #10
[ECCV2024] VideoMamba: Modelo de espacio de estados para una comprensión eficiente de video.
★ 1125+1Variación de estrellas de los últimos 7 días - #11
[ICLR2024 spotlight] OmniQuant es una técnica de cuantización simple y potente para LLM.
★ 911+3Variación de estrellas de los últimos 7 días - #12
[CVPR 2023] VideoMAE V2: escalado de Video Masked Autoencoders con enmascaramiento dual.
★ 816+2Variación de estrellas de los últimos 7 días - #13★ 746+0Variación de estrellas de los últimos 7 días
- #14
¡Chatbot Arena se encuentra con la multimodalidad! Multi-Modality Arena te permite comparar modelos de visión-lenguaje lado a lado mientras proporcionas imágenes como entrada. ¡Soporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 y muchos más!
★ 566+0Variación de estrellas de los últimos 7 días - #15
[ICLR 2025 Spotlight] Vision-RWKV: Percepción visual eficiente y escalable con arquitecturas tipo RWKV
★ 556+0Variación de estrellas de los últimos 7 días - #16
[ICLR2026] VideoChat-Flash: Compresión jerárquica para modelado de video de contexto largo
★ 528+0Variación de estrellas de los últimos 7 días - #17
[ICLR 2024 y ECCV 2024] Proyectos All-Seeing: Hacia el reconocimiento y comprensión visual panóptica y la comprensión general de relaciones en el mundo abierto.
★ 506+0Variación de estrellas de los últimos 7 días