large-multimodal-models
Repositórios de código aberto acompanhados marcados com large-multimodal-models, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de large-multimodal-models no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com large-multimodal-models.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
✨✨[NeurIPS 2025] VITA-1.5: Rumo à interação de visão e fala em tempo real no nível do GPT-4o
★ 2.532-1Variação de estrelas nos últimos 7 dias - #2
[ICCV 2025] Implementação para Describe Anything: Legendas detalhadas e localizadas de imagens e vídeos
★ 1.517+3Variação de estrelas nos últimos 7 dias - #3
Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.
★ 1.310+2Variação de estrelas nos últimos 7 dias - #4
[NeurIPS 2024] Uma implementação oficial de "ShareGPT4Video: Improving Video Understanding and Generation with Better Captions"
★ 1.094+1Variação de estrelas nos últimos 7 dias - #5
Um framework para modelos multimodais grandes de pequena escala.
★ 1.004+1Variação de estrelas nos últimos 7 dias - #6
Uma coleção de recursos sobre aplicações de aprendizado multimodal em imagens médicas.
★ 975+1Variação de estrelas nos últimos 7 dias - #7
LLaVA-Plus: Assistentes de linguagem e visão de grande escala que se conectam e aprendem a usar habilidades
★ 770+0Variação de estrelas nos últimos 7 dias - #8
Este repositório contém código de avaliação para o artigo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 593+1Variação de estrelas nos últimos 7 dias - #9
LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.
★ 577+0Variação de estrelas nos últimos 7 dias