vision-transformer
Repositórios de código aberto acompanhados marcados com vision-transformer, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de vision-transformer no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com vision-transformer.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Caixa de ferramentas e benchmark de detecção do OpenMMLab
★ 32.901+6Variação de estrelas nos últimos 7 dias - #2★ 16.549+0Variação de estrelas nos últimos 7 dias
- #3
Este repositório contém demonstrações que criei com a biblioteca Transformers da HuggingFace.
★ 11.748+0Variação de estrelas nos últimos 7 dias - #4
[Prêmio de Melhor Artigo NeurIPS 2024][GPT supera diffusion🔥] [leis de escala em geração visual📈] Implementação oficial de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Uma base de código ultra-simples, amigável e de última geração para geração de imagens autorregressivas!
★ 8.728-1Variação de estrelas nos últimos 7 dias - #5
Colete, analise e otimize qualquer formato de dados ➡️ de documentos a multimídia ➡️ para maior compatibilidade com frameworks de GenAI
★ 7.823+4Variação de estrelas nos últimos 7 dias - #6★ 5.586+6Variação de estrelas nos últimos 7 dias
- #7
MLX-VLM é um pacote para inferência e ajuste fino de Vision Language Models (VLMs) no seu Mac usando MLX.
★ 5.462+25Variação de estrelas nos últimos 7 dias - #8
Uma lista de artigos extremamente abrangente sobre Vision Transformer/Attention, incluindo artigos, códigos e sites relacionados
★ 5.046-3Variação de estrelas nos últimos 7 dias - #9
Backbones de IA eficientes, incluindo GhostNet, TNT e MLP, desenvolvidos pelo Huawei Noah's Ark Lab.
★ 4.419+1Variação de estrelas nos últimos 7 dias - #10
Caixa de ferramentas e benchmark de pré-treinamento da OpenMMLab
★ 3.850-1Variação de estrelas nos últimos 7 dias - #11
O primeiro plugin de visão para o DeepSeek Harness e a ponte visual para qualquer agente de codificação baseado em texto. Cole uma imagem e obtenha evidências JSON estruturadas (OCR, layout, semântica).
★ 3.839+83Variação de estrelas nos últimos 7 dias - #12★ 3.821+0Variação de estrelas nos últimos 7 dias
- #13
Towhee é um framework dedicado a tornar os pipelines de processamento de dados neurais simples e rápidos.
★ 3.453-1Variação de estrelas nos últimos 7 dias - #14
Modelos fundamentais de visão eficientes para geração e percepção de alta resolução.
★ 3.356+1Variação de estrelas nos últimos 7 dias - #15
InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração
★ 2.925-1Variação de estrelas nos últimos 7 dias - #16★ 2.695+2Variação de estrelas nos últimos 7 dias
- #17
[ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal
★ 2.374+5Variação de estrelas nos últimos 7 dias - #18
[CVPR 2025] Implementação oficial em PyTorch do MambaVision: Um backbone de visão híbrido Mamba-Transformer
★ 2.227+2Variação de estrelas nos últimos 7 dias - #19
Repositório oficial para [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" e [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"
★ 2.139+0Variação de estrelas nos últimos 7 dias - #20
[CVPR 2021] Implementação oficial em PyTorch para Transformer Interpretability Beyond Attention Visualization, um novo método para visualizar classificações por redes baseadas em Transformer.
★ 2.014+0Variação de estrelas nos últimos 7 dias - #21★ 1.955+1Variação de estrelas nos últimos 7 dias
- #22★ 1.841+2Variação de estrelas nos últimos 7 dias
- #23
Treinamento tudo-em-um para modelos de visão (YOLO, ViTs, RT-DETR, DINOv3): pré-treinamento, ajuste fino e destilação.
★ 1.656+4Variação de estrelas nos últimos 7 dias - #24
[ICLR 2023 Spotlight] Adaptador de Vision Transformer para predições densas
★ 1.503+1Variação de estrelas nos últimos 7 dias - #25
Uma lista curada de modelos de fundação para tarefas de visão e linguagem.
★ 1.177+0Variação de estrelas nos últimos 7 dias - #26
UNetFormer: Um transformer semelhante ao UNet para segmentação semântica eficiente de imagens de cenas urbanas de sensoriamento remoto, ISPRS. Inclui também outros vision transformers e CNNs para segmentação de imagens de satélite, aéreas e de UAV.
★ 1.101+3Variação de estrelas nos últimos 7 dias - #27
Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Variação de estrelas nos últimos 7 dias - #28
[ICML2025] SpargeAttention: Uma atenção esparsa livre de treinamento que acelera a inferência de qualquer modelo.
★ 1.045+3Variação de estrelas nos últimos 7 dias - #29
Lista de artigos de trabalhos recentes em Visão Computacional (CV)
★ 973+1Variação de estrelas nos últimos 7 dias - #30
Repositório do Vision Transformer com Deformable Attention (CVPR2022) e DAT++: Vision Transformer espacialmente dinâmico com Deformable Attention
★ 942+0Variação de estrelas nos últimos 7 dias