OpenGVLab
Repositórios de código aberto acompanhados de OpenGVLab, ordenados por estrelas.
- #1
[CVPR 2024 Oral] Família InternVL: Uma alternativa pioneira de código aberto ao GPT-4o.
★ 10.147+6Variação de estrelas nos últimos 7 dias - #2
[ICLR 2024] Ajuste fino (fine-tuning) do LLaMA para seguir instruções em menos de 1 hora e com 1,2 milhão de parâmetros
★ 5.914+0Variação de estrelas nos últimos 7 dias - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT com compreensão de vídeo! E muitos outros modelos de linguagem suportados, como miniGPT4, StableLM e MOSS.
★ 3.347+0Variação de estrelas nos últimos 7 dias - #4
InternGPT (iGPT) é uma plataforma de demonstração de código aberto onde você pode exibir facilmente seus modelos de IA. Agora suporta DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edição interativa de imagens, etc. Experimente em igpt.opengvlab.com.
★ 3.205+1Variação de estrelas nos últimos 7 dias - #5
[CVPR 2023 Highlight] InternImage: Explorando modelos de fundação de visão em larga escala com Deformable Convolutions
★ 2.841+2Variação de estrelas nos últimos 7 dias - #6
[ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal
★ 2.370+4Variação de estrelas nos últimos 7 dias - #7★ 1.154+1Variação de estrelas nos últimos 7 dias
- #8★ 1.134+1Variação de estrelas nos últimos 7 dias
- #9
[ICLR 2026 Oral] ScaleCUA é o agente de uso de computador de código aberto que pode operar em ambientes multiplataforma (Windows, macOS, Ubuntu, Android).
★ 1.133+3Variação de estrelas nos últimos 7 dias - #10
[ECCV2024] VideoMamba: Modelo de Espaço de Estados para compreensão eficiente de vídeo
★ 1.125+1Variação de estrelas nos últimos 7 dias - #11
[Destaque ICLR2024] OmniQuant é uma técnica de quantização simples e poderosa para LLMs.
★ 911+3Variação de estrelas nos últimos 7 dias - #12
[CVPR 2023] VideoMAE V2: Escalando Video Masked Autoencoders com mascaramento duplo
★ 818+2Variação de estrelas nos últimos 7 dias - #13★ 747+0Variação de estrelas nos últimos 7 dias
- #14
O Chatbot Arena encontra a multimodalidade! O Multi-Modality Arena permite comparar modelos de visão-linguagem lado a lado fornecendo imagens como entrada. Suporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 e muito mais!
★ 566+0Variação de estrelas nos últimos 7 dias - #15
[ICLR 2025 Spotlight] Vision-RWKV: Percepção visual eficiente e escalável com arquiteturas semelhantes ao RWKV.
★ 556+0Variação de estrelas nos últimos 7 dias - #16
[ICLR2026] VideoChat-Flash: Compressão hierárquica para modelagem de vídeo de contexto longo
★ 528+0Variação de estrelas nos últimos 7 dias - #17
[ICLR 2024 & ECCV 2024] Projetos The All-Seeing: Rumo ao reconhecimento e compreensão visual panóptica e compreensão de relações gerais no mundo aberto
★ 506+0Variação de estrelas nos últimos 7 dias