multimodal-large-language-models
Repositórios de código aberto acompanhados marcados com multimodal-large-language-models, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de multimodal-large-language-models no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com multimodal-large-language-models.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Últimos avanços em modelos de linguagem grandes multimodais.
★ 17.996+2Variação de estrelas nos últimos 7 dias - #2
Mobile-Agent: A poderosa família de agentes de GUI
★ 9.157+9Variação de estrelas nos últimos 7 dias - #3
StarVector é um modelo fundamental para geração de SVG que transforma a vetorização em uma tarefa de geração de código. Utilizando uma arquitetura de modelagem de visão e linguagem, o StarVector processa entradas visuais e textuais para produzir código SVG de alta qualidade com precisão notável.
★ 4.567+6Variação de estrelas nos últimos 7 dias - #4
LLaMA-Omni é um modelo de interação de voz end-to-end de baixa latência e alta qualidade construído sobre o Llama-3.1-8B-Instruct, visando alcançar capacidades de voz no nível do GPT-4o.
★ 3.147+1Variação de estrelas nos últimos 7 dias - #5
Um framework multiplataforma de estruturação de vídeo (análise de vídeo) baseado em modelos de CV e mLLM.
★ 2.933+0Variação de estrelas nos últimos 7 dias - #6
✨✨[NeurIPS 2025] VITA-1.5: Rumo à interação de visão e fala em tempo real no nível do GPT-4o
★ 2.532-1Variação de estrelas nos últimos 7 dias - #7
mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos
★ 2.411+0Variação de estrelas nos últimos 7 dias - #8
Cambrian-1 é uma família de LLMs multimodais com um design centrado em visão.
★ 2.014+1Variação de estrelas nos últimos 7 dias - #9
[ICML 2024] Dominando a Difusão de Texto para Imagem: Re-legenda, Planejamento e Geração com LLMs Multimodais (RPG)
★ 1.844+0Variação de estrelas nos últimos 7 dias - #10
Seed1.5-VL, um modelo de base de visão e linguagem projetado para promover a compreensão e o raciocínio multimodal de propósito geral, alcançando desempenho de ponta em 38 de 60 benchmarks públicos.
★ 1.586+0Variação de estrelas nos últimos 7 dias - #11
Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.
★ 1.514+2Variação de estrelas nos últimos 7 dias - #12
Modelos Multimodais Unificados Incríveis
★ 1.314+1Variação de estrelas nos últimos 7 dias - #13
Humano digital interativo em tempo real, com aparência e voz personalizáveis, suporte a clonagem de voz e latência de resposta inicial de até 3s.
★ 1.303-1Variação de estrelas nos últimos 7 dias - #14
Implementação em PyTorch do Audio Flamingo: uma série de modelos de linguagem avançados para compreensão de áudio.
★ 1.184+2Variação de estrelas nos últimos 7 dias - #15
Um framework para processamento de fala, linguagem, áudio e música com Large Language Model
★ 1.058+2Variação de estrelas nos últimos 7 dias - #16★ 1.053+0Variação de estrelas nos últimos 7 dias
- #17
Raciocínio multimodal de cadeia de pensamento: um levantamento abrangente
★ 1.025+2Variação de estrelas nos últimos 7 dias - #18
Uma coleção de recursos sobre aplicações de aprendizado multimodal em imagens médicas.
★ 975+1Variação de estrelas nos últimos 7 dias - #19
Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais
★ 889+0Variação de estrelas nos últimos 7 dias - #20
✨✨[CVPR 2025] Video-MME: O primeiro benchmark de avaliação abrangente para LLMs multimodais em análise de vídeo.
★ 791+2Variação de estrelas nos últimos 7 dias - #21
LLaVA-Plus: Assistentes de linguagem e visão de grande escala que se conectam e aprendem a usar habilidades
★ 770+0Variação de estrelas nos últimos 7 dias - #22
[CVPR 2024] MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
★ 706+0Variação de estrelas nos últimos 7 dias - #23★ 702+0Variação de estrelas nos últimos 7 dias
- #24
Projeto Pessoal: MPP-Qwen14B & MPP-Qwen-Next (Pipeline Paralelo Multimodal baseado em Qwen-LM). Suporta [vídeo/imagem/várias imagens] {sft/conversas}. Não deixe a pobreza limitar sua imaginação! Treine seu próprio MLLM semelhante ao LLaVA de 8B/14B em RTX3090/4090 24GB.
★ 687+0Variação de estrelas nos últimos 7 dias - #25★ 678+0Variação de estrelas nos últimos 7 dias
- #26
✨✨Woodpecker: Correção de alucinação para Modelos de Linguagem Multimodais Grandes
★ 650+1Variação de estrelas nos últimos 7 dias - #27
(Aceito no IJCV) Liquid: Modelos de linguagem são geradores multimodais escaláveis e unificados
★ 640+0Variação de estrelas nos últimos 7 dias - #28
Artigo do NeurIPS 2024: Um LLM de visão em nível de pixel unificado para compreensão, geração, segmentação e edição
★ 577+1Variação de estrelas nos últimos 7 dias - #29
LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.
★ 577+0Variação de estrelas nos últimos 7 dias - #30
Cambrian-S: Rumo à supersensoriamento espacial em vídeo
★ 567-1Variação de estrelas nos últimos 7 dias