vlm
Repositórios de código aberto acompanhados marcados com vlm, ordenados por estrelas.
- #31
O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.
★ 1.840+10Variação de estrelas nos últimos 7 dias - #32
🚀🚀🚀 Uma coleção de projetos públicos incríveis da série YOLO de detecção de objetos e conjuntos de dados relacionados.
★ 1.783-2Variação de estrelas nos últimos 7 dias - #33
Maneira declarativa de executar modelos de IA no React Native localmente, utilizando o ExecuTorch.
★ 1.707+5Variação de estrelas nos últimos 7 dias - #34
OpenGUI é um framework de agente GUI para Android voltado para IA, capaz de visualizar, planejar e operar aplicativos móveis reais através da interface gráfica.
★ 1.624+38Variação de estrelas nos últimos 7 dias - #35
Toolkit de compressão de modelos projetado para maior usabilidade, abrangência e eficiência.
★ 1.619+58Variação de estrelas nos últimos 7 dias - #36
Awesome-Jailbreak-on-LLMs é uma coleção de métodos de jailbreak de ponta, inovadores e interessantes para LLMs. Contém artigos, códigos, conjuntos de dados, avaliações e análises.
★ 1.610+5Variação de estrelas nos últimos 7 dias - #37★ 1.507+2Variação de estrelas nos últimos 7 dias
- #38
Otimização de design de aeronaves acelerada por transformações de grafos computacionais (por exemplo, diferenciação automática). Ferramentas de análise combináveis para aerodinâmica, propulsão, estruturas, design de trajetória e muito mais.
★ 1.323+4Variação de estrelas nos últimos 7 dias - #39
Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.
★ 1.310+2Variação de estrelas nos últimos 7 dias - #40
JoyCaption é um Visual Language Model (VLM) de legendagem de imagens construído do zero como um modelo gratuito, aberto e sem censura para a comunidade usar no treinamento de modelos de difusão.
★ 1.248+1Variação de estrelas nos últimos 7 dias - #41★ 1.195+1Variação de estrelas nos últimos 7 dias
- #42
Plataforma aberta da InternRobotics para construir modelos fundamentais de navegação generalizada.
★ 1.090+18Variação de estrelas nos últimos 7 dias - #43★ 1.053+0Variação de estrelas nos últimos 7 dias
- #44
MindSpore + 🤗Huggingface: Execute qualquer modelo Transformers/Diffusers no MindSpore com compatibilidade perfeita e aceleração.
★ 920+0Variação de estrelas nos últimos 7 dias - #45
Biblioteca de treinamento distribuído nativo em PyTorch para LLMs/VLMs com suporte imediato ao Hugging Face.
★ 910+25Variação de estrelas nos últimos 7 dias - #46
Assistente de GPT completo para Android, ativado por teclas de volume para interação por voz, com suporte a rede, fotos, modelos, análise de documentos e modo de agente.
★ 901+1Variação de estrelas nos últimos 7 dias - #47
UniWorld: Codificadores semânticos de alta resolução para compreensão e geração visual unificadas.
★ 890+0Variação de estrelas nos últimos 7 dias - #48
Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais
★ 889+0Variação de estrelas nos últimos 7 dias - #49★ 875+1Variação de estrelas nos últimos 7 dias
- #50
Base de código unificada para Modelos de Mundo Avançados.
★ 868+2Variação de estrelas nos últimos 7 dias - #51
Uma lista com curadoria de artigos de visão 3D relacionados ao domínio de robótica na era de grandes modelos, como LLMs/VLMs, inspirada no awesome-computer-vision, incluindo artigos, códigos e sites relacionados
★ 822+2Variação de estrelas nos últimos 7 dias - #52
Repositório oficial do artigo de pesquisa "LLM × DATA".
★ 821+2Variação de estrelas nos últimos 7 dias - #53
🚀🚀🚀Uma coleção de projetos públicos incríveis sobre Modelos de Linguagem de Grande Escala (LLM), Modelos de Visão e Linguagem (VLM), Visão, Linguagem e Ação (VLA), Conteúdo Gerado por IA (AIGC), além de conjuntos de dados e aplicativos relacionados.
★ 815+1Variação de estrelas nos últimos 7 dias - #54
MobileGym: Uma plataforma de simulação verificável e altamente paralela para pesquisa de agentes de GUI móveis · Simulador Android executado no navegador · Simulador Android hospedado no navegador · Avaliação Verificável · Treinamento RL online escalável
★ 786+10Variação de estrelas nos últimos 7 dias - #55
[CVPR 2026🔥] 🧑🎨 OmniLottie, um gerador de animação vetorial instruída multimodal de código aberto que produz arquivos JSON Lottie.
★ 775+3Variação de estrelas nos últimos 7 dias - #56
Dingo: Uma ferramenta abrangente de avaliação de qualidade de dados, modelos e aplicações de IA
★ 754+4Variação de estrelas nos últimos 7 dias - #57
[CVPR 2024 🔥] GeoChat, o primeiro Large Vision Language Model fundamentado para Sensoriamento Remoto
★ 752+7Variação de estrelas nos últimos 7 dias - #58
[ECCV 2026] SparkVSR: Super-resolução de vídeo interativa via propagação de keyframes esparsos
★ 702+3Variação de estrelas nos últimos 7 dias - #59
Engine de IA de borda em C++ pronta para produção para análise de vídeo e VLM em dispositivos em Sophon, Rockchip RKNN e x86, com orquestração visual, OSD em tempo real, eventos e benchmarks reproduzíveis.
★ 690+47Variação de estrelas nos últimos 7 dias - #60
Este repositório contém o código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] e "MMEB-V3" [COLM 2026].
★ 682+2Variação de estrelas nos últimos 7 dias