mllm
Repositórios de código aberto acompanhados marcados com mllm, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de mllm no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com mllm.
- #1
Visão como Geração Multimodal Unificada
★ 674
- #1
Pré-treinamento autossupervisionado em larga escala entre tarefas, idiomas e modalidades
★ 22.203+9Variação de estrelas nos últimos 7 dias - #2★ 12.219+26Variação de estrelas nos últimos 7 dias
- #3
Mobile-Agent: A poderosa família de agentes de GUI
★ 9.157+19Variação de estrelas nos últimos 7 dias - #4
[NeurIPS 2025] SpatialLM: Treinamento de grandes modelos de linguagem para modelagem interna estruturada
★ 4.726+8Variação de estrelas nos últimos 7 dias - #5
[CVPR'25] Implementações oficiais do artigo - MagicQuill: Um sistema inteligente de edição interativa de imagens.
★ 3.691+3Variação de estrelas nos últimos 7 dias - #6
De Chain-of-Thought prompting para OpenAI o1 e DeepSeek-R1 🍓
★ 3.681+6Variação de estrelas nos últimos 7 dias - #7
Código e modelos para o artigo do ICML 2024, NExT-GPT: Any-to-Any Multimodal Large Language Model
★ 3.634-3Variação de estrelas nos últimos 7 dias - #8★ 3.511+46Variação de estrelas nos últimos 7 dias
- #9
InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração
★ 2.925+0Variação de estrelas nos últimos 7 dias - #10
mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos
★ 2.411+0Variação de estrelas nos últimos 7 dias - #11
Cambrian-1 é uma família de LLMs multimodais com um design centrado em visão.
★ 2.014+1Variação de estrelas nos últimos 7 dias - #12
🚀🚀🚀 Uma coleção de projetos públicos incríveis da série YOLO de detecção de objetos e conjuntos de dados relacionados.
★ 1.783+0Variação de estrelas nos últimos 7 dias - #13
Repositório oficial do código Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1ª solução para LSVOS)
★ 1.666+0Variação de estrelas nos últimos 7 dias - #14★ 1.570+9Variação de estrelas nos últimos 7 dias
- #15
Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.
★ 1.310+4Variação de estrelas nos últimos 7 dias - #16
Framework totalmente aberto para treinamento multimodal democratizado
★ 1.195+3Variação de estrelas nos últimos 7 dias - #17★ 1.053+0Variação de estrelas nos últimos 7 dias
- #18
OpenEMMA, uma 'reprodução' de código aberto licenciada de forma branda do modelo EMMA da Waymo.
★ 951+0Variação de estrelas nos últimos 7 dias - #19
Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais
★ 888+0Variação de estrelas nos últimos 7 dias - #20
[NeurIPS' 2025] JarvisArt: Liberando a criatividade artística humana por meio de um agente inteligente de retoque fotográfico.
★ 862+1Variação de estrelas nos últimos 7 dias - #21
[CVPR2024] O código para "Osprey: Pixel Understanding with Visual Instruction Tuning"
★ 843+0Variação de estrelas nos últimos 7 dias - #22
[Destaque NeurIPS 2025] Implementação oficial de "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving"
★ 827+6Variação de estrelas nos últimos 7 dias - #23
[NeurIPS 2025] 4KAgent: Agente de Super-Resolução 4K para Qualquer Imagem. Um agente de visão computacional inteligente que restaura magicamente qualquer imagem para o formato 4K perfeito!
★ 819+0Variação de estrelas nos últimos 7 dias - #24
🚀🚀🚀Uma coleção de projetos públicos incríveis sobre Modelos de Linguagem de Grande Escala (LLM), Modelos de Visão e Linguagem (VLM), Visão, Linguagem e Ação (VLA), Conteúdo Gerado por IA (AIGC), além de conjuntos de dados e aplicativos relacionados.
★ 814+0Variação de estrelas nos últimos 7 dias - #25
Este é um repositório para listar artigos sobre geração de grafos de cena e aplicação.
★ 724+5Variação de estrelas nos últimos 7 dias - #26
Projeto Pessoal: MPP-Qwen14B & MPP-Qwen-Next (Pipeline Paralelo Multimodal baseado em Qwen-LM). Suporta [vídeo/imagem/várias imagens] {sft/conversas}. Não deixe a pobreza limitar sua imaginação! Treine seu próprio MLLM semelhante ao LLaVA de 8B/14B em RTX3090/4090 24GB.
★ 686+0Variação de estrelas nos últimos 7 dias - #27
Visão como Geração Multimodal Unificada
★ 674+20Variação de estrelas nos últimos 7 dias - #28
✨✨Woodpecker: Correção de alucinação para Modelos de Linguagem Multimodais Grandes
★ 649+1Variação de estrelas nos últimos 7 dias - #29
[ICLR 2025] FakeShield: Detecção e localização explicável de falsificação de imagens por meio de Large Language Models multimodais
★ 623+2Variação de estrelas nos últimos 7 dias - #30
Emotion-LLaMA: Reconhecimento e Raciocínio de Emoções Multimodais com Ajuste de Instruções
★ 616-1Variação de estrelas nos últimos 7 dias