Pular para o conteúdo principal
buildradar
Sign in
Tópico · mllm

mllm

Repositórios de código aberto acompanhados marcados com mllm, ordenados por estrelas.

Repositórios
36
Total de estrelas
92.155
Média de estrelas
2.560
Participação
0,00%

Tópicos que aparecem com frequência ao lado de mllm no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com mllm.

  • unilm@microsoft

    Pré-treinamento autossupervisionado em larga escala entre tarefas, idiomas e modalidades

    22.203+9Variação de estrelas nos últimos 7 dias
  • Agent-S@simular-ai

    Agent S: um framework agêntico aberto que usa computadores como um humano

    12.219+26Variação de estrelas nos últimos 7 dias
  • MobileAgent@X-PLUG

    Mobile-Agent: A poderosa família de agentes de GUI

    9.157+19Variação de estrelas nos últimos 7 dias
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: Treinamento de grandes modelos de linguagem para modelagem interna estruturada

    4.726+8Variação de estrelas nos últimos 7 dias
  • MagicQuill@robbyant-research

    [CVPR'25] Implementações oficiais do artigo - MagicQuill: Um sistema inteligente de edição interativa de imagens.

    3.691+3Variação de estrelas nos últimos 7 dias
  • De Chain-of-Thought prompting para OpenAI o1 e DeepSeek-R1 🍓

    3.681+6Variação de estrelas nos últimos 7 dias
  • NExT-GPT@NExT-GPT

    Código e modelos para o artigo do ICML 2024, NExT-GPT: Any-to-Any Multimodal Large Language Model

    3.634-3Variação de estrelas nos últimos 7 dias
  • Eagle@NVlabs

    Eagle: Modelos de visão-linguagem de fronteira com estratégias centradas em dados

    3.511+46Variação de estrelas nos últimos 7 dias
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração

    2.925+0Variação de estrelas nos últimos 7 dias
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos

    2.411+0Variação de estrelas nos últimos 7 dias
  • cambrian@cambrian-mllm

    Cambrian-1 é uma família de LLMs multimodais com um design centrado em visão.

    2.014+1Variação de estrelas nos últimos 7 dias
  • 🚀🚀🚀 Uma coleção de projetos públicos incríveis da série YOLO de detecção de objetos e conjuntos de dados relacionados.

    1.783+0Variação de estrelas nos últimos 7 dias
  • Sa2VA@bytedance

    Repositório oficial do código Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1ª solução para LSVOS)

    1.666+0Variação de estrelas nos últimos 7 dias
  • Rex-Omni@IDEA-Research

    [CVPR2026] Detecte qualquer coisa via Next Point Prediction

    1.570+9Variação de estrelas nos últimos 7 dias
  • Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.

    1.310+4Variação de estrelas nos últimos 7 dias
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework totalmente aberto para treinamento multimodal democratizado

    1.195+3Variação de estrelas nos últimos 7 dias
  • Bunny@BAAI-DCAI

    Uma família de modelos multimodais leves.

    1.053+0Variação de estrelas nos últimos 7 dias
  • OpenEMMA@taco-group

    OpenEMMA, uma 'reprodução' de código aberto licenciada de forma branda do modelo EMMA da Waymo.

    951+0Variação de estrelas nos últimos 7 dias
  • NEO@EvolvingLMMs-Lab

    Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais

    888+0Variação de estrelas nos últimos 7 dias
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: Liberando a criatividade artística humana por meio de um agente inteligente de retoque fotográfico.

    862+1Variação de estrelas nos últimos 7 dias
  • Osprey@CircleRadon

    [CVPR2024] O código para "Osprey: Pixel Understanding with Visual Instruction Tuning"

    843+0Variação de estrelas nos últimos 7 dias
  • FSDrive@MIV-XJTU

    [Destaque NeurIPS 2025] Implementação oficial de "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving"

    827+6Variação de estrelas nos últimos 7 dias
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: Agente de Super-Resolução 4K para Qualquer Imagem. Um agente de visão computacional inteligente que restaura magicamente qualquer imagem para o formato 4K perfeito!

    819+0Variação de estrelas nos últimos 7 dias
  • 🚀🚀🚀Uma coleção de projetos públicos incríveis sobre Modelos de Linguagem de Grande Escala (LLM), Modelos de Visão e Linguagem (VLM), Visão, Linguagem e Ação (VLA), Conteúdo Gerado por IA (AIGC), além de conjuntos de dados e aplicativos relacionados.

    814+0Variação de estrelas nos últimos 7 dias
  • Este é um repositório para listar artigos sobre geração de grafos de cena e aplicação.

    724+5Variação de estrelas nos últimos 7 dias
  • MPP-LLaVA@Coobiw

    Projeto Pessoal: MPP-Qwen14B & MPP-Qwen-Next (Pipeline Paralelo Multimodal baseado em Qwen-LM). Suporta [vídeo/imagem/várias imagens] {sft/conversas}. Não deixe a pobreza limitar sua imaginação! Treine seu próprio MLLM semelhante ao LLaVA de 8B/14B em RTX3090/4090 24GB.

    686+0Variação de estrelas nos últimos 7 dias
  • SenseNova-Vision@OpenSenseNova

    Visão como Geração Multimodal Unificada

    674+20Variação de estrelas nos últimos 7 dias
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Correção de alucinação para Modelos de Linguagem Multimodais Grandes

    649+1Variação de estrelas nos últimos 7 dias
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: Detecção e localização explicável de falsificação de imagens por meio de Large Language Models multimodais

    623+2Variação de estrelas nos últimos 7 dias
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: Reconhecimento e Raciocínio de Emoções Multimodais com Ajuste de Instruções

    616-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos