vision-language-model
Repositórios de código aberto acompanhados marcados com vision-language-model, ordenados por estrelas.
- #31★ 1.309+0Variação de estrelas nos últimos 7 dias
- #32
Framework totalmente aberto para treinamento multimodal democratizado
★ 1.195+1Variação de estrelas nos últimos 7 dias - #33
Esta série levará você em uma jornada desde os fundamentos de NLP e Visão Computacional até o estado da arte em Modelos de Visão-Linguagem.
★ 1.179+0Variação de estrelas nos últimos 7 dias - #34★ 1.153-25Variação de estrelas nos últimos 7 dias
- #35
Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.
★ 1.136+18Variação de estrelas nos últimos 7 dias - #36★ 979-1Variação de estrelas nos últimos 7 dias
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), o primeiro modelo do gênero capaz de gerar respostas em linguagem natural perfeitamente integradas com máscaras de segmentação de objetos.
★ 967+0Variação de estrelas nos últimos 7 dias - #38
[CVPR 2024 Highlight] Chat-UniVi: Representação visual unificada que capacita grandes modelos de linguagem com compreensão de imagem e vídeo.
★ 941+0Variação de estrelas nos últimos 7 dias - #39
Sobre este repositório: uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2025. 🔥 [Artigo + Código + Demonstração]
★ 895+1Variação de estrelas nos últimos 7 dias - #40★ 874+0Variação de estrelas nos últimos 7 dias
- #41
[dsh] Integração nativa do DeepSeek Harness para o agent-vision-toolkit: perguntas e respostas sobre imagens, OCR de capturas de tela longas, restauração de UI, grounding, diff de pixels, Artifacts e Web UI.
★ 856+17Variação de estrelas nos últimos 7 dias - #42
VoxPoser: Mapas de Valores 3D Componíveis para Manipulação Robótica com Language Models
★ 834+1Variação de estrelas nos últimos 7 dias - #43
[Destaque NeurIPS 2025] OpenCUA: Fundações abertas para agentes de uso de computador
★ 833+4Variação de estrelas nos últimos 7 dias - #44
🍃 MINT-1T: Um conjunto de dados multimodal intercalado de um trilhão de tokens.
★ 832+0Variação de estrelas nos últimos 7 dias - #45
Uma lista com curadoria de artigos de visão 3D relacionados ao domínio de robótica na era de grandes modelos, como LLMs/VLMs, inspirada no awesome-computer-vision, incluindo artigos, códigos e sites relacionados
★ 821+2Variação de estrelas nos últimos 7 dias - #46
Uma lista curada de métodos incríveis de aprendizado de prompt/adapter para modelos de visão-linguagem como o CLIP.
★ 797+1Variação de estrelas nos últimos 7 dias - #47
[ICLR 2026] A implementação oficial de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
★ 725+5Variação de estrelas nos últimos 7 dias - #48★ 677+0Variação de estrelas nos últimos 7 dias
- #49★ 642+0Variação de estrelas nos últimos 7 dias
- #50
🎉 PILOT: Uma caixa de ferramentas de aprendizado contínuo baseada em modelo pré-treinado
★ 601+3Variação de estrelas nos últimos 7 dias - #51
Avaliando modelos de texto para imagem/vídeo/3D com VQAScore
★ 600+0Variação de estrelas nos últimos 7 dias - #52
[CVPR 2026] SpatialVID: Um conjunto de dados de vídeo em larga escala com anotações espaciais
★ 600+1Variação de estrelas nos últimos 7 dias - #53★ 596—Variação de estrelas nos últimos 7 dias
- #54
[ECCV2024] Modelo de Linguagem Grande Multimodal Fundamentado com Tokenização Visual Localizada
★ 586+0Variação de estrelas nos últimos 7 dias - #55
LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.
★ 577+0Variação de estrelas nos últimos 7 dias - #56
Cambrian-S: Rumo à supersensoriamento espacial em vídeo
★ 567-1Variação de estrelas nos últimos 7 dias - #57
O Chatbot Arena encontra a multimodalidade! O Multi-Modality Arena permite comparar modelos de visão-linguagem lado a lado fornecendo imagens como entrada. Suporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 e muito mais!
★ 566+0Variação de estrelas nos últimos 7 dias - #58
O Flame é um sistema de IA multimodal de código aberto projetado para traduzir protótipos de design de interface em código React de alta qualidade. Ele aproveita modelagem de visão-linguagem, síntese automatizada de dados e fluxos de trabalho de treinamento estruturados para preencher a lacuna entre o design e o desenvolvimento front-end.
★ 562+0Variação de estrelas nos últimos 7 dias - #59
Código e diretrizes de implementação para o artigo ✨Counting Anything. Página do projeto: https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2Variação de estrelas nos últimos 7 dias