vision-language-model
Repositórios de código aberto acompanhados marcados com vision-language-model, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de vision-language-model no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com vision-language-model.
- #1★ 1.153
- #2
Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.
★ 1.136 - #3
[dsh] Integração nativa do DeepSeek Harness para o agent-vision-toolkit: perguntas e respostas sobre imagens, OCR de capturas de tela longas, restauração de UI, grounding, diff de pixels, Artifacts e Web UI.
★ 856 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.
★ 25.014+9Variação de estrelas nos últimos 7 dias - #2
X-AnyLabeling: Uma aplicação desktop multiplataforma leve, eficiente e unificada para anotação de texto, imagem, vídeo e dados multimodais, combinando ferramentas integradas versáteis com modelos de IA de última geração e exportação flexível em múltiplos formatos.
★ 10.313+59Variação de estrelas nos últimos 7 dias - #3
[CVPR 2024 Oral] Família InternVL: Uma alternativa pioneira de código aberto ao GPT-4o.
★ 10.150+3Variação de estrelas nos últimos 7 dias - #4
👀 Treine um VLM de 65M de parâmetros do zero em apenas 2h!
★ 8.535+40Variação de estrelas nos últimos 7 dias - #5
O repositório oficial do Qwen-VL (通义千问-VL), modelo de linguagem de visão grande pré-treinado e de chat proposto pela Alibaba Cloud.
★ 6.727+1Variação de estrelas nos últimos 7 dias - #6
MineContext é seu parceiro de IA proativo e consciente do contexto (Engenharia de Contexto + ChatGPT Pulse)
★ 5.497+1Variação de estrelas nos últimos 7 dias - #7
MLX-VLM é um pacote para inferência e ajuste fino de Vision Language Models (VLMs) no seu Mac usando MLX.
★ 5.462+25Variação de estrelas nos últimos 7 dias - #8
Align Anything: Treinamento de modelos multimodais com feedback
★ 4.671+3Variação de estrelas nos últimos 7 dias - #9
Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.
★ 4.390+7Variação de estrelas nos últimos 7 dias - #10
DeepSeek-VL: Rumo à compreensão de visão e linguagem no mundo real
★ 4.177+2Variação de estrelas nos últimos 7 dias - #11
Repositório oficial do MiniMax-Text-01 e MiniMax-VL-01, modelos de linguagem e visão baseados em Linear Attention.
★ 3.467+0Variação de estrelas nos últimos 7 dias - #12
Repositório oficial para "Mini-Gemini: Mineração do Potencial de Modelos de Linguagem Visual Multimodais"
★ 3.327+0Variação de estrelas nos últimos 7 dias - #13
Coleção de modelos de visão e linguagem (vision-language models) para tarefas de visão computacional.
★ 3.126+0Variação de estrelas nos últimos 7 dias - #14
O canivete suíço da IA offline. Converse, veja, fale e gere imagens no seu celular ou Mac — LLMs GGUF, visão, transcrição de fala Whisper, Stable Diffusion, chamadas de ferramentas e servidores de rede local. Executa na sua CPU, GPU ou NPU. Sem conta, sem chave de API, nenhum dado sai do seu dispositivo.
★ 3.038+17Variação de estrelas nos últimos 7 dias - #15
InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração
★ 2.925-1Variação de estrelas nos últimos 7 dias - #16
Código utilizado para treinar e executar inferência com os modelos ColVision, como ColPali, ColQwen2 e ColSmol.
★ 2.809+7Variação de estrelas nos últimos 7 dias - #17
O framework Cradle é uma primeira tentativa de Controle Geral de Computador (GCC). O Cradle permite que agentes realizem qualquer tarefa computacional ao habilitar fortes capacidades de raciocínio, autoaperfeiçoamento e curadoria de habilidades, em um ambiente geral padronizado com requisitos mínimos.
★ 2.578+2Variação de estrelas nos últimos 7 dias - #18
Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.
★ 1.961+1Variação de estrelas nos últimos 7 dias - #19
[CVPR 2025] Modelo de Visão-Linguagem-Ação de código aberto, ponta a ponta, para agente de GUI e uso de computador
★ 1.896+2Variação de estrelas nos últimos 7 dias - #20
Uma lista selecionada de recursos incríveis sobre LLM/VLM/VLA/World Model para Condução Autônoma (LLM4AD) (atualizada continuamente).
★ 1.890-2Variação de estrelas nos últimos 7 dias - #21
O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.
★ 1.840+10Variação de estrelas nos últimos 7 dias - #22
Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835+1Variação de estrelas nos últimos 7 dias - #23
Seed1.5-VL, um modelo de base de visão e linguagem projetado para promover a compreensão e o raciocínio multimodal de propósito geral, alcançando desempenho de ponta em 38 de 60 benchmarks públicos.
★ 1.586+0Variação de estrelas nos últimos 7 dias - #24
Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.
★ 1.557+6Variação de estrelas nos últimos 7 dias - #25
Obtenha dados limpos de documentos complexos, com tecnologia de modelos de visão e linguagem ⚡.
★ 1.524+0Variação de estrelas nos últimos 7 dias - #26
[ICCV 2025] Implementação para Describe Anything: Legendas detalhadas e localizadas de imagens e vídeos
★ 1.517+3Variação de estrelas nos últimos 7 dias - #27
Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.
★ 1.514+2Variação de estrelas nos últimos 7 dias - #28
Resumo de LLMs em japonês - Visão geral de LLMs japoneses
★ 1.428+1Variação de estrelas nos últimos 7 dias - #29
Faça o fine-tuning de LLMs no seu Mac com Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding e fine-tuning de OCR — nativamente no MLX. API compatível com Unsloth.
★ 1.398+8Variação de estrelas nos últimos 7 dias - #30
Modelos Multimodais Unificados Incríveis
★ 1.314+1Variação de estrelas nos últimos 7 dias