Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · vision-transformer

vision-transformer

Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-transformer, sắp xếp theo số sao.

Kho mã
45
Tổng số sao
154.486
Số sao trung bình
3.433
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng vision-transformer trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ vision-transformer.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • mmdetection@open-mmlab

    Bộ công cụ và điểm chuẩn phát hiện OpenMMLab

    32.901+6Thay đổi số sao trong 7 ngày qua
  • LaTeX-OCR@lukas-blecher

    pix2tex: Sử dụng ViT để chuyển đổi hình ảnh phương trình thành mã LaTeX.

    16.549+0Thay đổi số sao trong 7 ngày qua
  • Transformers-Tutorials@NielsRogge

    Kho lưu trữ này chứa các bản demo tôi đã tạo bằng thư viện Transformers của HuggingFace.

    11.748+0Thay đổi số sao trong 7 ngày qua
  • VAR@FoundationVision

    [Giải Thưởng Bài Báo Xuất Sắc Nhất NeurIPS 2024][GPT vượt trội hơn diffusion🔥] [Định luật quy mô trong tạo ảnh thị giác📈] Bản cài đặt chính thức của "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Một mã nguồn *cực kỳ đơn giản, thân thiện với người dùng nhưng đạt chuẩn tối tân* để tạo ảnh tự hồi quy!

    8.728-1Thay đổi số sao trong 7 ngày qua
  • omniparse@adithya-s-k

    Thu thập, phân tích cú pháp và tối ưu hóa mọi định dạng dữ liệu ➡️ từ tài liệu đến đa phương tiện ➡️ để nâng cao khả năng tương thích với các framework GenAI

    7.823+4Thay đổi số sao trong 7 ngày qua
  • SwinIR@JingyunLiang

    SwinIR: Phục hồi hình ảnh sử dụng Swin Transformer (repository chính thức)

    5.586+6Thay đổi số sao trong 7 ngày qua
  • mlx-vlm@Blaizzy

    MLX-VLM là một gói để suy luận và tinh chỉnh các Mô hình Ngôn ngữ Thị giác (VLM) trên Mac sử dụng MLX.

    5.462+25Thay đổi số sao trong 7 ngày qua
  • Danh sách tài liệu nghiên cứu cực kỳ toàn diện về Vision Transformer/Attention, bao gồm các bài báo, mã nguồn và các trang web liên quan

    5.046-3Thay đổi số sao trong 7 ngày qua
  • Efficient-AI-Backbones@huawei-noah

    Các AI backbone hiệu quả bao gồm GhostNet, TNT và MLP, được phát triển bởi Phòng thí nghiệm Noah's Ark của Huawei.

    4.419+1Thay đổi số sao trong 7 ngày qua
  • mmpretrain@open-mmlab

    Bộ công cụ huấn luyện trước và tiêu chuẩn đánh giá của OpenMMLab

    3.850-1Thay đổi số sao trong 7 ngày qua
  • modlens@liustack

    Plugin thị giác đầu tiên cho DeepSeek Harness, và cầu nối thị giác cho mọi coding agent chỉ hỗ trợ văn bản. Dán hình ảnh, nhận dữ liệu JSON có cấu trúc (OCR, bố cục, ngữ nghĩa).

    3.839+83Thay đổi số sao trong 7 ngày qua
  • scenic@google-research

    Scenic: Thư viện Jax dành cho nghiên cứu thị giác máy tính và hơn thế nữa

    3.821+0Thay đổi số sao trong 7 ngày qua
  • towhee@towhee-io

    Towhee là một framework chuyên dụng giúp các đường ống xử lý dữ liệu thần kinh trở nên đơn giản và nhanh chóng.

    3.453-1Thay đổi số sao trong 7 ngày qua
  • efficientvit@mit-han-lab

    Các mô hình nền tảng thị giác hiệu quả dành cho việc tạo và nhận diện độ phân giải cao

    3.356+1Thay đổi số sao trong 7 ngày qua
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Hệ thống đa phương thức toàn diện cho tương tác video và âm thanh phát streaming thời gian dài

    2.925-1Thay đổi số sao trong 7 ngày qua
  • EVA@baaivision

    Dòng EVA: Hình ảnh biểu diễn tưởng tượng từ BAAI

    2.695+2Thay đổi số sao trong 7 ngày qua
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data dành cho thấu hiểu đa phương thức

    2.374+5Thay đổi số sao trong 7 ngày qua
  • MambaVision@NVlabs

    [CVPR 2025] Triển khai PyTorch chính thức của MambaVision: Một xương sống tầm nhìn Mamba-Transformer lai

    2.227+2Thay đổi số sao trong 7 ngày qua
  • ViTPose@ViTAE-Transformer

    Kho lưu trữ chính thức cho [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" và [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"

    2.139+0Thay đổi số sao trong 7 ngày qua
  • Transformer-Explainability@hila-chefer

    [CVPR 2021] Bản triển khai chính thức trên PyTorch cho Transformer Interpretability Beyond Attention Visualization, một phương pháp mới để trực quan hóa việc phân loại bởi các mạng dựa trên Transformer.

    2.014+0Thay đổi số sao trong 7 ngày qua
  • EasyCV@alibaba

    Một bộ công cụ tất cả trong một dành cho thị giác máy tính

    1.955+1Thay đổi số sao trong 7 ngày qua
  • Cream@microsoft

    Đây là bộ sưu tập các công trình về NAS và Vision Transformer của chúng tôi.

    1.841+2Thay đổi số sao trong 7 ngày qua
  • lightly-train@lightly-ai

    Huấn luyện tất cả trong một cho các mô hình thị giác (YOLO, ViTs, RT-DETR, DINOv3): tiền huấn luyện, tinh chỉnh, chưng cất.

    1.656+4Thay đổi số sao trong 7 ngày qua
  • ViT-Adapter@czczup

    [ICLR 2023 Spotlight] Vision Transformer Adapter cho dự đoán dày đặc (Dense Predictions)

    1.503+1Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các mô hình nền tảng cho các tác vụ thị giác máy tính và ngôn ngữ

    1.177+0Thay đổi số sao trong 7 ngày qua
  • GeoSeg@WangLibo1995

    UNetFormer: Một transformer kiểu UNet để phân đoạn ngữ nghĩa hiệu quả hình ảnh cảnh quan đô thị viễn thám, ISPRS. Ngoài ra, bao gồm các vision transformer và CNN khác cho việc phân đoạn hình ảnh vệ tinh, hình ảnh trên không và hình ảnh UAV.

    1.101+3Thay đổi số sao trong 7 ngày qua
  • ONE-PEACE@OFA-Sys

    Mô hình biểu diễn tổng quát cho các phương thức thị giác, âm thanh và ngôn ngữ. Bài báo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Thay đổi số sao trong 7 ngày qua
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Cơ chế chú ý thưa thớt không cần huấn luyện giúp tăng tốc suy luận của mọi mô hình.

    1.045+3Thay đổi số sao trong 7 ngày qua
  • :fire: :fire: :fire: Danh sách bài báo về một số công trình Thị giác Máy tính (CV) gần đây

    973+1Thay đổi số sao trong 7 ngày qua
  • DAT@LeapLabTHU

    Kho lưu trữ Vision Transformer với Deformable Attention (CVPR2022) và DAT++: Spatially Dynamic Vision Transformer với Deformable Attention

    942+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề