Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal-large-language-models

multimodal-large-language-models

Repositórios de código aberto acompanhados marcados com multimodal-large-language-models, ordenados por estrelas.

Repositórios
32
Total de estrelas
66.902
Média de estrelas
2.091
Participação
0,00%

Tópicos que aparecem com frequência ao lado de multimodal-large-language-models no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com multimodal-large-language-models.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • Últimos avanços em modelos de linguagem grandes multimodais.

    17.996+2Variação de estrelas nos últimos 7 dias
  • MobileAgent@X-PLUG

    Mobile-Agent: A poderosa família de agentes de GUI

    9.157+9Variação de estrelas nos últimos 7 dias
  • star-vector@joanrod

    StarVector é um modelo fundamental para geração de SVG que transforma a vetorização em uma tarefa de geração de código. Utilizando uma arquitetura de modelagem de visão e linguagem, o StarVector processa entradas visuais e textuais para produzir código SVG de alta qualidade com precisão notável.

    4.567+6Variação de estrelas nos últimos 7 dias
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni é um modelo de interação de voz end-to-end de baixa latência e alta qualidade construído sobre o Llama-3.1-8B-Instruct, visando alcançar capacidades de voz no nível do GPT-4o.

    3.147+1Variação de estrelas nos últimos 7 dias
  • VideoPipe@sherlockchou86

    Um framework multiplataforma de estruturação de vídeo (análise de vídeo) baseado em modelos de CV e mLLM.

    2.933+0Variação de estrelas nos últimos 7 dias
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Rumo à interação de visão e fala em tempo real no nível do GPT-4o

    2.532-1Variação de estrelas nos últimos 7 dias
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos

    2.411+0Variação de estrelas nos últimos 7 dias
  • cambrian@cambrian-mllm

    Cambrian-1 é uma família de LLMs multimodais com um design centrado em visão.

    2.014+1Variação de estrelas nos últimos 7 dias
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Dominando a Difusão de Texto para Imagem: Re-legenda, Planejamento e Geração com LLMs Multimodais (RPG)

    1.844+0Variação de estrelas nos últimos 7 dias
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, um modelo de base de visão e linguagem projetado para promover a compreensão e o raciocínio multimodal de propósito geral, alcançando desempenho de ponta em 38 de 60 benchmarks públicos.

    1.586+0Variação de estrelas nos últimos 7 dias
  • Ovis@ATH-MaaS

    Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.

    1.514+2Variação de estrelas nos últimos 7 dias
  • Modelos Multimodais Unificados Incríveis

    1.314+1Variação de estrelas nos últimos 7 dias
  • VideoChat@Henry-23

    Humano digital interativo em tempo real, com aparência e voz personalizáveis, suporte a clonagem de voz e latência de resposta inicial de até 3s.

    1.303-1Variação de estrelas nos últimos 7 dias
  • Implementação em PyTorch do Audio Flamingo: uma série de modelos de linguagem avançados para compreensão de áudio.

    1.184+2Variação de estrelas nos últimos 7 dias
  • SLAM-LLM@X-LANCE

    Um framework para processamento de fala, linguagem, áudio e música com Large Language Model

    1.058+2Variação de estrelas nos últimos 7 dias
  • Bunny@BAAI-DCAI

    Uma família de modelos multimodais leves.

    1.053+0Variação de estrelas nos últimos 7 dias
  • Awesome-MCoT@yaotingwangofficial

    Raciocínio multimodal de cadeia de pensamento: um levantamento abrangente

    1.025+2Variação de estrelas nos últimos 7 dias
  • Uma coleção de recursos sobre aplicações de aprendizado multimodal em imagens médicas.

    975+1Variação de estrelas nos últimos 7 dias
  • NEO@EvolvingLMMs-Lab

    Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais

    889+0Variação de estrelas nos últimos 7 dias
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME: O primeiro benchmark de avaliação abrangente para LLMs multimodais em análise de vídeo.

    791+2Variação de estrelas nos últimos 7 dias
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: Assistentes de linguagem e visão de grande escala que se conectam e aprendem a usar habilidades

    770+0Variação de estrelas nos últimos 7 dias
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: From Dense Token to Sparse Memory for Long Video Understanding

    706+0Variação de estrelas nos últimos 7 dias
  • unicom@deepglint

    Modelo de representação visual em larga escala

    702+0Variação de estrelas nos últimos 7 dias
  • MPP-LLaVA@Coobiw

    Projeto Pessoal: MPP-Qwen14B & MPP-Qwen-Next (Pipeline Paralelo Multimodal baseado em Qwen-LM). Suporta [vídeo/imagem/várias imagens] {sft/conversas}. Não deixe a pobreza limitar sua imaginação! Treine seu próprio MLLM semelhante ao LLaVA de 8B/14B em RTX3090/4090 24GB.

    687+0Variação de estrelas nos últimos 7 dias
  • OmniVinci@NVlabs

    OmniVinci é um LLM onimodal para compreensão conjunta de visão, áudio e linguagem.

    678+0Variação de estrelas nos últimos 7 dias
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Correção de alucinação para Modelos de Linguagem Multimodais Grandes

    650+1Variação de estrelas nos últimos 7 dias
  • Liquid@FoundationVision

    (Aceito no IJCV) Liquid: Modelos de linguagem são geradores multimodais escaláveis e unificados

    640+0Variação de estrelas nos últimos 7 dias
  • Vitron@SkyworkAI

    Artigo do NeurIPS 2024: Um LLM de visão em nível de pixel unificado para compreensão, geração, segmentação e edição

    577+1Variação de estrelas nos últimos 7 dias
  • LLaVA-Mini@ictnlp

    LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.

    577+0Variação de estrelas nos últimos 7 dias
  • cambrian-s@cambrian-mllm

    Cambrian-S: Rumo à supersensoriamento espacial em vídeo

    567-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos