vision-transformer
Dépôts open source suivis étiquetés vision-transformer, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de vision-transformer sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés vision-transformer.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Boîte à outils et benchmark de détection OpenMMLab
★ 32 901+6Évolution des étoiles sur les 7 derniers jours - #2
pix2tex : Utilisation d'un ViT pour convertir des images d'équations en code LaTeX.
★ 16 549+0Évolution des étoiles sur les 7 derniers jours - #3
Ce dépôt contient des démonstrations réalisées avec la bibliothèque Transformers de HuggingFace.
★ 11 748+0Évolution des étoiles sur les 7 derniers jours - #4
[Prix du meilleur article NeurIPS 2024][GPT surpasse la diffusion🔥] [lois d'échelle en génération visuelle📈] Implémentation officielle de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Une base de code ultra-simple, intuitive et à la pointe de la technologie pour la génération d'images autorégressive.
★ 8 728-1Évolution des étoiles sur les 7 derniers jours - #5
Ingérez, analysez et optimisez tout format de données, des documents au multimédia, pour une meilleure compatibilité avec les frameworks GenAI.
★ 7 823+4Évolution des étoiles sur les 7 derniers jours - #6★ 5 586+6Évolution des étoiles sur les 7 derniers jours
- #7
MLX-VLM est un package pour l'inférence et le réglage fin de modèles de vision par langage (VLM) sur Mac via MLX.
★ 5 462+25Évolution des étoiles sur les 7 derniers jours - #8
Une liste exhaustive d'articles sur les Vision Transformers et l'attention, incluant articles, codes et sites web associés.
★ 5 046-3Évolution des étoiles sur les 7 derniers jours - #9
Backbones IA efficaces incluant GhostNet, TNT et MLP, développés par le laboratoire Noah's Ark de Huawei.
★ 4 419+1Évolution des étoiles sur les 7 derniers jours - #10
Boîte à outils et benchmark de pré-entraînement OpenMMLab.
★ 3 850-1Évolution des étoiles sur les 7 derniers jours - #11
Le premier plugin de vision pour DeepSeek Harness, et le pont visuel pour tout agent de codage textuel. Collez une image et obtenez des preuves JSON structurées (OCR, mise en page, sémantique).
★ 3 839+83Évolution des étoiles sur les 7 derniers jours - #12
Scenic : une bibliothèque Jax pour la recherche en vision par ordinateur et au-delà.
★ 3 821+0Évolution des étoiles sur les 7 derniers jours - #13
Towhee est un framework dédié à la simplification et à l'accélération des pipelines de traitement de données neuronales.
★ 3 453-1Évolution des étoiles sur les 7 derniers jours - #14
Modèles de vision fondamentaux efficaces pour la génération et la perception haute résolution.
★ 3 356+1Évolution des étoiles sur les 7 derniers jours - #15
InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.
★ 2 925-1Évolution des étoiles sur les 7 derniers jours - #16★ 2 695+2Évolution des étoiles sur les 7 derniers jours
- #17
[ECCV2024] Modèles de fondation vidéo et données pour la compréhension multimodale.
★ 2 374+5Évolution des étoiles sur les 7 derniers jours - #18
[CVPR 2025] Implémentation PyTorch officielle de MambaVision : une architecture de vision hybride Mamba-Transformer.
★ 2 227+2Évolution des étoiles sur les 7 derniers jours - #19
Le dépôt officiel pour [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" et [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"
★ 2 139+0Évolution des étoiles sur les 7 derniers jours - #20
[CVPR 2021] Implémentation PyTorch officielle pour l'interprétabilité des Transformers au-delà de la visualisation de l'attention, une nouvelle méthode pour visualiser les classifications par les réseaux basés sur les Transformers.
★ 2 014+0Évolution des étoiles sur les 7 derniers jours - #21★ 1 955+1Évolution des étoiles sur les 7 derniers jours
- #22★ 1 841+2Évolution des étoiles sur les 7 derniers jours
- #23
Entraînement tout-en-un pour les modèles de vision (YOLO, ViTs, RT-DETR, DINOv3) : pré-entraînement, réglage fin et distillation.
★ 1 656+4Évolution des étoiles sur les 7 derniers jours - #24
[ICLR 2023 Spotlight] Vision Transformer Adapter pour les prédictions denses.
★ 1 503+1Évolution des étoiles sur les 7 derniers jours - #25
Une liste organisée de modèles de fondation pour les tâches de vision et de langage.
★ 1 177+0Évolution des étoiles sur les 7 derniers jours - #26
UNetFormer : un transformer de type UNet pour la segmentation sémantique efficace d'imagerie urbaine par télédétection (ISPRS). Inclut également d'autres vision transformers et CNN pour la segmentation d'images satellites, aériennes et de drones.
★ 1 101+3Évolution des étoiles sur les 7 derniers jours - #27
Un modèle de représentation général pour les modalités vision, audio et langage. Article : ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1 060+0Évolution des étoiles sur les 7 derniers jours - #28
[ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.
★ 1 045+1Évolution des étoiles sur les 7 derniers jours - #29
Une liste d'articles sur des travaux récents en vision par ordinateur (CV)
★ 973+1Évolution des étoiles sur les 7 derniers jours - #30
Modèles de segmentation sémantique SOTA en PyTorch
★ 942-1Évolution des étoiles sur les 7 derniers jours