vision-transformer
Repositori open source terpantau bertanda vision-transformer, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan vision-transformer di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda vision-transformer.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Toolbox dan tolok ukur deteksi OpenMMLab.
★ 32.901+6Perubahan bintang dalam 7 hari terakhir - #2
pix2tex: Menggunakan ViT untuk mengonversi gambar persamaan menjadi kode LaTeX.
★ 16.549+0Perubahan bintang dalam 7 hari terakhir - #3
Repositori ini berisi demo yang saya buat dengan pustaka Transformers oleh HuggingFace.
★ 11.748+0Perubahan bintang dalam 7 hari terakhir - #4
[NeurIPS 2024 Best Paper Award][GPT mengalahkan diffusion🔥] [hukum scaling dalam visual generation📈] Implementasi resmi dari "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Basis kode yang *sangat sederhana, ramah pengguna, namun canggih* untuk pembuatan gambar autoregresif!
★ 8.728-1Perubahan bintang dalam 7 hari terakhir - #5
Ingest, urai, dan optimalkan format data apa pun ➡️ dari dokumen hingga multimedia ➡️ untuk kompatibilitas yang ditingkatkan dengan framework GenAI
★ 7.823+4Perubahan bintang dalam 7 hari terakhir - #6★ 5.586+6Perubahan bintang dalam 7 hari terakhir
- #7
MLX-VLM adalah paket untuk inferensi dan fine-tuning Vision Language Models (VLM) di Mac menggunakan MLX.
★ 5.462+25Perubahan bintang dalam 7 hari terakhir - #8
Daftar makalah yang sangat komprehensif mengenai Vision Transformer/Attention, mencakup makalah, kode, dan situs web terkait.
★ 5.046-3Perubahan bintang dalam 7 hari terakhir - #9
Backbone AI efisien termasuk GhostNet, TNT, dan MLP, dikembangkan oleh Huawei Noah's Ark Lab.
★ 4.419+1Perubahan bintang dalam 7 hari terakhir - #10
Kotak Alat Pra-pelatihan dan Tolok Ukur OpenMMLab
★ 3.850-1Perubahan bintang dalam 7 hari terakhir - #11
Plugin visual pertama untuk DeepSeek Harness, dan jembatan visual untuk setiap agen koding teks saja. Tempel gambar, dapatkan bukti JSON terstruktur (OCR, tata letak, semantik).
★ 3.839+83Perubahan bintang dalam 7 hari terakhir - #12★ 3.821+0Perubahan bintang dalam 7 hari terakhir
- #13
Towhee adalah kerangka kerja yang didedikasikan untuk membuat alur kerja pemrosesan data saraf menjadi sederhana dan cepat.
★ 3.453-1Perubahan bintang dalam 7 hari terakhir - #14
Model fondasi visi yang efisien untuk generasi dan persepsi resolusi tinggi.
★ 3.356+1Perubahan bintang dalam 7 hari terakhir - #15
InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang
★ 2.925-1Perubahan bintang dalam 7 hari terakhir - #16★ 2.695+2Perubahan bintang dalam 7 hari terakhir
- #17
[ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal
★ 2.374+5Perubahan bintang dalam 7 hari terakhir - #18
[CVPR 2025] Implementasi Resmi PyTorch dari MambaVision: Tulang Punggung Visi Hibrida Mamba-Transformer
★ 2.227+2Perubahan bintang dalam 7 hari terakhir - #19
Repositori resmi untuk [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" dan [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"
★ 2.139+0Perubahan bintang dalam 7 hari terakhir - #20
[CVPR 2021] Implementasi resmi PyTorch untuk Transformer Interpretability Beyond Attention Visualization, metode baru untuk memvisualisasikan klasifikasi oleh jaringan berbasis Transformer.
★ 2.014+0Perubahan bintang dalam 7 hari terakhir - #21★ 1.955+1Perubahan bintang dalam 7 hari terakhir
- #22★ 1.841+2Perubahan bintang dalam 7 hari terakhir
- #23
Pelatihan all-in-one untuk model visi (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distilasi.
★ 1.656+4Perubahan bintang dalam 7 hari terakhir - #24
[ICLR 2023 Spotlight] Vision Transformer Adapter untuk Prediksi Dense
★ 1.503+1Perubahan bintang dalam 7 hari terakhir - #25
Daftar terkurasi dari foundation models untuk tugas visi dan bahasa
★ 1.177+0Perubahan bintang dalam 7 hari terakhir - #26
UNetFormer: Transformer mirip UNet untuk segmentasi semantik yang efisien pada citra pemandangan perkotaan penginderaan jauh, ISPRS. Juga mencakup vision transformer dan CNN lainnya untuk segmentasi citra satelit, udara, dan UAV.
★ 1.101+3Perubahan bintang dalam 7 hari terakhir - #27
Model representasi umum lintas modalitas visi, audio, dan bahasa. Makalah: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Perubahan bintang dalam 7 hari terakhir - #28
[ICML2025] SpargeAttention: Perhatian jarang tanpa pelatihan yang mempercepat inferensi model apa pun.
★ 1.045+3Perubahan bintang dalam 7 hari terakhir - #29
:fire: :fire: :fire: Daftar makalah dari beberapa karya Computer Vision (CV) terkini
★ 973+1Perubahan bintang dalam 7 hari terakhir - #30
Repositori Vision Transformer dengan Deformable Attention (CVPR2022) dan DAT++: Spatially Dynamic Vision Transformer dengan Deformable Attention
★ 943+0Perubahan bintang dalam 7 hari terakhir