Lompat ke konten utama
buildradar
Sign in
Topik · vision-transformer

vision-transformer

Repositori open source terpantau bertanda vision-transformer, diurutkan berdasarkan bintang.

Repositori
45
Total bintang
154.486
Rata-rata bintang
3.433
Porsi
0,01%

Topik yang sering muncul berdampingan dengan vision-transformer di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda vision-transformer.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • mmdetection@open-mmlab

    Toolbox dan tolok ukur deteksi OpenMMLab.

    32.901+6Perubahan bintang dalam 7 hari terakhir
  • LaTeX-OCR@lukas-blecher

    pix2tex: Menggunakan ViT untuk mengonversi gambar persamaan menjadi kode LaTeX.

    16.549+0Perubahan bintang dalam 7 hari terakhir
  • Transformers-Tutorials@NielsRogge

    Repositori ini berisi demo yang saya buat dengan pustaka Transformers oleh HuggingFace.

    11.748+0Perubahan bintang dalam 7 hari terakhir
  • VAR@FoundationVision

    [NeurIPS 2024 Best Paper Award][GPT mengalahkan diffusion🔥] [hukum scaling dalam visual generation📈] Implementasi resmi dari "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Basis kode yang *sangat sederhana, ramah pengguna, namun canggih* untuk pembuatan gambar autoregresif!

    8.728-1Perubahan bintang dalam 7 hari terakhir
  • omniparse@adithya-s-k

    Ingest, urai, dan optimalkan format data apa pun ➡️ dari dokumen hingga multimedia ➡️ untuk kompatibilitas yang ditingkatkan dengan framework GenAI

    7.823+4Perubahan bintang dalam 7 hari terakhir
  • SwinIR@JingyunLiang

    SwinIR: Restorasi gambar menggunakan Swin Transformer (repositori resmi)

    5.586+6Perubahan bintang dalam 7 hari terakhir
  • mlx-vlm@Blaizzy

    MLX-VLM adalah paket untuk inferensi dan fine-tuning Vision Language Models (VLM) di Mac menggunakan MLX.

    5.462+25Perubahan bintang dalam 7 hari terakhir
  • Daftar makalah yang sangat komprehensif mengenai Vision Transformer/Attention, mencakup makalah, kode, dan situs web terkait.

    5.046-3Perubahan bintang dalam 7 hari terakhir
  • Efficient-AI-Backbones@huawei-noah

    Backbone AI efisien termasuk GhostNet, TNT, dan MLP, dikembangkan oleh Huawei Noah's Ark Lab.

    4.419+1Perubahan bintang dalam 7 hari terakhir
  • mmpretrain@open-mmlab

    Kotak Alat Pra-pelatihan dan Tolok Ukur OpenMMLab

    3.850-1Perubahan bintang dalam 7 hari terakhir
  • modlens@liustack

    Plugin visual pertama untuk DeepSeek Harness, dan jembatan visual untuk setiap agen koding teks saja. Tempel gambar, dapatkan bukti JSON terstruktur (OCR, tata letak, semantik).

    3.839+83Perubahan bintang dalam 7 hari terakhir
  • scenic@google-research

    Scenic: Pustaka Jax untuk penelitian Computer Vision dan seterusnya

    3.821+0Perubahan bintang dalam 7 hari terakhir
  • towhee@towhee-io

    Towhee adalah kerangka kerja yang didedikasikan untuk membuat alur kerja pemrosesan data saraf menjadi sederhana dan cepat.

    3.453-1Perubahan bintang dalam 7 hari terakhir
  • efficientvit@mit-han-lab

    Model fondasi visi yang efisien untuk generasi dan persepsi resolusi tinggi.

    3.356+1Perubahan bintang dalam 7 hari terakhir
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang

    2.925-1Perubahan bintang dalam 7 hari terakhir
  • EVA@baaivision

    EVA Series: Visual Representation Fantasies dari BAAI

    2.695+2Perubahan bintang dalam 7 hari terakhir
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal

    2.374+5Perubahan bintang dalam 7 hari terakhir
  • MambaVision@NVlabs

    [CVPR 2025] Implementasi Resmi PyTorch dari MambaVision: Tulang Punggung Visi Hibrida Mamba-Transformer

    2.227+2Perubahan bintang dalam 7 hari terakhir
  • ViTPose@ViTAE-Transformer

    Repositori resmi untuk [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" dan [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"

    2.139+0Perubahan bintang dalam 7 hari terakhir
  • Transformer-Explainability@hila-chefer

    [CVPR 2021] Implementasi resmi PyTorch untuk Transformer Interpretability Beyond Attention Visualization, metode baru untuk memvisualisasikan klasifikasi oleh jaringan berbasis Transformer.

    2.014+0Perubahan bintang dalam 7 hari terakhir
  • EasyCV@alibaba

    Toolkit serbaguna untuk visi komputer

    1.955+1Perubahan bintang dalam 7 hari terakhir
  • Cream@microsoft

    Ini adalah kumpulan karya NAS dan Vision Transformer kami.

    1.841+2Perubahan bintang dalam 7 hari terakhir
  • lightly-train@lightly-ai

    Pelatihan all-in-one untuk model visi (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distilasi.

    1.656+4Perubahan bintang dalam 7 hari terakhir
  • ViT-Adapter@czczup

    [ICLR 2023 Spotlight] Vision Transformer Adapter untuk Prediksi Dense

    1.503+1Perubahan bintang dalam 7 hari terakhir
  • Daftar terkurasi dari foundation models untuk tugas visi dan bahasa

    1.177+0Perubahan bintang dalam 7 hari terakhir
  • GeoSeg@WangLibo1995

    UNetFormer: Transformer mirip UNet untuk segmentasi semantik yang efisien pada citra pemandangan perkotaan penginderaan jauh, ISPRS. Juga mencakup vision transformer dan CNN lainnya untuk segmentasi citra satelit, udara, dan UAV.

    1.101+3Perubahan bintang dalam 7 hari terakhir
  • ONE-PEACE@OFA-Sys

    Model representasi umum lintas modalitas visi, audio, dan bahasa. Makalah: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Perubahan bintang dalam 7 hari terakhir
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Perhatian jarang tanpa pelatihan yang mempercepat inferensi model apa pun.

    1.045+3Perubahan bintang dalam 7 hari terakhir
  • :fire: :fire: :fire: Daftar makalah dari beberapa karya Computer Vision (CV) terkini

    973+1Perubahan bintang dalam 7 hari terakhir
  • DAT@LeapLabTHU

    Repositori Vision Transformer dengan Deformable Attention (CVPR2022) dan DAT++: Spatially Dynamic Vision Transformer dengan Deformable Attention

    943+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik