Pular para o conteúdo principal
buildradar
Sign in
Tópico · vision-language-model

vision-language-model

Repositórios de código aberto acompanhados marcados com vision-language-model, ordenados por estrelas.

59 repositórios
  • prismer@NVlabs

    Implementação de "Prismer: A Vision-Language Model with Multi-Task Experts".

    1.309+0Variação de estrelas nos últimos 7 dias
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework totalmente aberto para treinamento multimodal democratizado

    1.195+1Variação de estrelas nos últimos 7 dias
  • vlms-zero-to-hero@SkalskiP

    Esta série levará você em uma jornada desde os fundamentos de NLP e Visão Computacional até o estado da arte em Modelos de Visão-Linguagem.

    1.179+0Variação de estrelas nos últimos 7 dias
  • doc7@magicrew

    Transforme documentos em Markdown pronto para IA com compreensão visual

    1.153-25Variação de estrelas nos últimos 7 dias
  • Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.

    1.136+18Variação de estrelas nos últimos 7 dias
  • VisRAG@OpenBMB

    RAG sem parsing suportado por VLM

    979-1Variação de estrelas nos últimos 7 dias
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), o primeiro modelo do gênero capaz de gerar respostas em linguagem natural perfeitamente integradas com máscaras de segmentação de objetos.

    967+0Variação de estrelas nos últimos 7 dias
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight] Chat-UniVi: Representação visual unificada que capacita grandes modelos de linguagem com compreensão de imagem e vídeo.

    941+0Variação de estrelas nos últimos 7 dias
  • Sobre este repositório: uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2025. 🔥 [Artigo + Código + Demonstração]

    895+1Variação de estrelas nos últimos 7 dias
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Um modelo CLIP que foca onde você quiser

    874+0Variação de estrelas nos últimos 7 dias
  • dsh-vision-toolkit@Anionex

    [dsh] Integração nativa do DeepSeek Harness para o agent-vision-toolkit: perguntas e respostas sobre imagens, OCR de capturas de tela longas, restauração de UI, grounding, diff de pixels, Artifacts e Web UI.

    856+17Variação de estrelas nos últimos 7 dias
  • VoxPoser@huangwl18

    VoxPoser: Mapas de Valores 3D Componíveis para Manipulação Robótica com Language Models

    834+1Variação de estrelas nos últimos 7 dias
  • OpenCUA@xlang-ai

    [Destaque NeurIPS 2025] OpenCUA: Fundações abertas para agentes de uso de computador

    833+4Variação de estrelas nos últimos 7 dias
  • MINT-1T@mlfoundations

    🍃 MINT-1T: Um conjunto de dados multimodal intercalado de um trilhão de tokens.

    832+0Variação de estrelas nos últimos 7 dias
  • Uma lista com curadoria de artigos de visão 3D relacionados ao domínio de robótica na era de grandes modelos, como LLMs/VLMs, inspirada no awesome-computer-vision, incluindo artigos, códigos e sites relacionados

    821+2Variação de estrelas nos últimos 7 dias
  • Uma lista curada de métodos incríveis de aprendizado de prompt/adapter para modelos de visão-linguagem como o CLIP.

    797+1Variação de estrelas nos últimos 7 dias
  • X-VLA@2toinf

    [ICLR 2026] A implementação oficial de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

    725+5Variação de estrelas nos últimos 7 dias
  • OmniVinci@NVlabs

    OmniVinci é um LLM onimodal para compreensão conjunta de visão, áudio e linguagem.

    677+0Variação de estrelas nos últimos 7 dias
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Variação de estrelas nos últimos 7 dias
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: Uma caixa de ferramentas de aprendizado contínuo baseada em modelo pré-treinado

    601+3Variação de estrelas nos últimos 7 dias
  • t2v_metrics@linzhiqiu

    Avaliando modelos de texto para imagem/vídeo/3D com VQAScore

    600+0Variação de estrelas nos últimos 7 dias
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: Um conjunto de dados de vídeo em larga escala com anotações espaciais

    600+1Variação de estrelas nos últimos 7 dias
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variação de estrelas nos últimos 7 dias
  • Groma@FoundationVision

    [ECCV2024] Modelo de Linguagem Grande Multimodal Fundamentado com Tokenização Visual Localizada

    586+0Variação de estrelas nos últimos 7 dias
  • LLaVA-Mini@ictnlp

    LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.

    577+0Variação de estrelas nos últimos 7 dias
  • cambrian-s@cambrian-mllm

    Cambrian-S: Rumo à supersensoriamento espacial em vídeo

    567-1Variação de estrelas nos últimos 7 dias
  • Multi-Modality-Arena@OpenGVLab

    O Chatbot Arena encontra a multimodalidade! O Multi-Modality Arena permite comparar modelos de visão-linguagem lado a lado fornecendo imagens como entrada. Suporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 e muito mais!

    566+0Variação de estrelas nos últimos 7 dias
  • Flame-Code-VLM@Flame-Code-VLM

    O Flame é um sistema de IA multimodal de código aberto projetado para traduzir protótipos de design de interface em código React de alta qualidade. Ele aproveita modelagem de visão-linguagem, síntese automatizada de dados e fluxos de trabalho de treinamento estruturados para preencher a lacuna entre o design e o desenvolvimento front-end.

    562+0Variação de estrelas nos últimos 7 dias
  • count-anything@Mengqi-Lei

    Código e diretrizes de implementação para o artigo ✨Counting Anything. Página do projeto: https://mengqi-lei.github.io/count-anything-projectpage/

    539+2Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos