Pular para o conteúdo principal
buildradar
Sign in
Tópico · vision-language-model

vision-language-model

Repositórios de código aberto acompanhados marcados com vision-language-model, ordenados por estrelas.

Repositórios
59
Total de estrelas
150.825
Média de estrelas
2.556
Participação
0,01%

Tópicos que aparecem com frequência ao lado de vision-language-model no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com vision-language-model.

  • doc7@magicrew

    Transforme documentos em Markdown pronto para IA com compreensão visual

    1.153
  • Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.

    1.136
  • dsh-vision-toolkit@Anionex

    [dsh] Integração nativa do DeepSeek Harness para o agent-vision-toolkit: perguntas e respostas sobre imagens, OCR de capturas de tela longas, restauração de UI, grounding, diff de pixels, Artifacts e Web UI.

    856
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.

    25.014+9Variação de estrelas nos últimos 7 dias
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: Uma aplicação desktop multiplataforma leve, eficiente e unificada para anotação de texto, imagem, vídeo e dados multimodais, combinando ferramentas integradas versáteis com modelos de IA de última geração e exportação flexível em múltiplos formatos.

    10.313+59Variação de estrelas nos últimos 7 dias
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] Família InternVL: Uma alternativa pioneira de código aberto ao GPT-4o.

    10.150+3Variação de estrelas nos últimos 7 dias
  • minimind-v@jingyaogong

    👀 Treine um VLM de 65M de parâmetros do zero em apenas 2h!

    8.535+40Variação de estrelas nos últimos 7 dias
  • Qwen-VL@QwenLM

    O repositório oficial do Qwen-VL (通义千问-VL), modelo de linguagem de visão grande pré-treinado e de chat proposto pela Alibaba Cloud.

    6.727+1Variação de estrelas nos últimos 7 dias
  • MineContext@volcengine

    MineContext é seu parceiro de IA proativo e consciente do contexto (Engenharia de Contexto + ChatGPT Pulse)

    5.497+1Variação de estrelas nos últimos 7 dias
  • mlx-vlm@Blaizzy

    MLX-VLM é um pacote para inferência e ajuste fino de Vision Language Models (VLMs) no seu Mac usando MLX.

    5.462+25Variação de estrelas nos últimos 7 dias
  • align-anything@PKU-Alignment

    Align Anything: Treinamento de modelos multimodais com feedback

    4.671+3Variação de estrelas nos últimos 7 dias
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.

    4.390+7Variação de estrelas nos últimos 7 dias
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: Rumo à compreensão de visão e linguagem no mundo real

    4.177+2Variação de estrelas nos últimos 7 dias
  • MiniMax-01@MiniMax-AI

    Repositório oficial do MiniMax-Text-01 e MiniMax-VL-01, modelos de linguagem e visão baseados em Linear Attention.

    3.467+0Variação de estrelas nos últimos 7 dias
  • MGM@JIA-Lab-research

    Repositório oficial para "Mini-Gemini: Mineração do Potencial de Modelos de Linguagem Visual Multimodais"

    3.327+0Variação de estrelas nos últimos 7 dias
  • VLM_survey@jingyi0000

    Coleção de modelos de visão e linguagem (vision-language models) para tarefas de visão computacional.

    3.126+0Variação de estrelas nos últimos 7 dias
  • OGAM@off-grid-ai

    O canivete suíço da IA offline. Converse, veja, fale e gere imagens no seu celular ou Mac — LLMs GGUF, visão, transcrição de fala Whisper, Stable Diffusion, chamadas de ferramentas e servidores de rede local. Executa na sua CPU, GPU ou NPU. Sem conta, sem chave de API, nenhum dado sai do seu dispositivo.

    3.038+17Variação de estrelas nos últimos 7 dias
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração

    2.925-1Variação de estrelas nos últimos 7 dias
  • colpali@illuin-tech

    Código utilizado para treinar e executar inferência com os modelos ColVision, como ColPali, ColQwen2 e ColSmol.

    2.809+7Variação de estrelas nos últimos 7 dias
  • Cradle@BAAI-Agents

    O framework Cradle é uma primeira tentativa de Controle Geral de Computador (GCC). O Cradle permite que agentes realizem qualquer tarefa computacional ao habilitar fortes capacidades de raciocínio, autoaperfeiçoamento e curadoria de habilidades, em um ambiente geral padronizado com requisitos mínimos.

    2.578+2Variação de estrelas nos últimos 7 dias
  • Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.

    1.961+1Variação de estrelas nos últimos 7 dias
  • ShowUI@showlab

    [CVPR 2025] Modelo de Visão-Linguagem-Ação de código aberto, ponta a ponta, para agente de GUI e uso de computador

    1.896+2Variação de estrelas nos últimos 7 dias
  • Awesome-LLM4AD@Thinklab-SJTU

    Uma lista selecionada de recursos incríveis sobre LLM/VLM/VLA/World Model para Condução Autônoma (LLM4AD) (atualizada continuamente).

    1.890-2Variação de estrelas nos últimos 7 dias
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.

    1.840+10Variação de estrelas nos últimos 7 dias
  • AdvancedLiterateMachinery@AlibabaResearch

    Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.

    1.835+1Variação de estrelas nos últimos 7 dias
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, um modelo de base de visão e linguagem projetado para promover a compreensão e o raciocínio multimodal de propósito geral, alcançando desempenho de ponta em 38 de 60 benchmarks públicos.

    1.586+0Variação de estrelas nos últimos 7 dias
  • vllm-mlx@waybarrios

    Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.

    1.557+6Variação de estrelas nos últimos 7 dias
  • thepipe@emcf

    Obtenha dados limpos de documentos complexos, com tecnologia de modelos de visão e linguagem ⚡.

    1.524+0Variação de estrelas nos últimos 7 dias
  • [ICCV 2025] Implementação para Describe Anything: Legendas detalhadas e localizadas de imagens e vídeos

    1.517+3Variação de estrelas nos últimos 7 dias
  • Ovis@ATH-MaaS

    Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.

    1.514+2Variação de estrelas nos últimos 7 dias
  • awesome-japanese-llm@llm-jp

    Resumo de LLMs em japonês - Visão geral de LLMs japoneses

    1.428+1Variação de estrelas nos últimos 7 dias
  • mlx-tune@ARahim3

    Faça o fine-tuning de LLMs no seu Mac com Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding e fine-tuning de OCR — nativamente no MLX. API compatível com Unsloth.

    1.398+8Variação de estrelas nos últimos 7 dias
  • Modelos Multimodais Unificados Incríveis

    1.314+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos