vision-transformer
Các kho mã nguồn mở đang theo dõi được gắn thẻ vision-transformer, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng vision-transformer trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ vision-transformer.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Bộ công cụ và điểm chuẩn phát hiện OpenMMLab
★ 32.901+6Thay đổi số sao trong 7 ngày qua - #2★ 16.549+0Thay đổi số sao trong 7 ngày qua
- #3
Kho lưu trữ này chứa các bản demo tôi đã tạo bằng thư viện Transformers của HuggingFace.
★ 11.748+0Thay đổi số sao trong 7 ngày qua - #4
[Giải Thưởng Bài Báo Xuất Sắc Nhất NeurIPS 2024][GPT vượt trội hơn diffusion🔥] [Định luật quy mô trong tạo ảnh thị giác📈] Bản cài đặt chính thức của "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Một mã nguồn *cực kỳ đơn giản, thân thiện với người dùng nhưng đạt chuẩn tối tân* để tạo ảnh tự hồi quy!
★ 8.728-1Thay đổi số sao trong 7 ngày qua - #5
Thu thập, phân tích cú pháp và tối ưu hóa mọi định dạng dữ liệu ➡️ từ tài liệu đến đa phương tiện ➡️ để nâng cao khả năng tương thích với các framework GenAI
★ 7.823+4Thay đổi số sao trong 7 ngày qua - #6★ 5.586+6Thay đổi số sao trong 7 ngày qua
- #7
MLX-VLM là một gói để suy luận và tinh chỉnh các Mô hình Ngôn ngữ Thị giác (VLM) trên Mac sử dụng MLX.
★ 5.462+25Thay đổi số sao trong 7 ngày qua - #8
Danh sách tài liệu nghiên cứu cực kỳ toàn diện về Vision Transformer/Attention, bao gồm các bài báo, mã nguồn và các trang web liên quan
★ 5.046-3Thay đổi số sao trong 7 ngày qua - #9
Các AI backbone hiệu quả bao gồm GhostNet, TNT và MLP, được phát triển bởi Phòng thí nghiệm Noah's Ark của Huawei.
★ 4.419+1Thay đổi số sao trong 7 ngày qua - #10
Bộ công cụ huấn luyện trước và tiêu chuẩn đánh giá của OpenMMLab
★ 3.850-1Thay đổi số sao trong 7 ngày qua - #11
Plugin thị giác đầu tiên cho DeepSeek Harness, và cầu nối thị giác cho mọi coding agent chỉ hỗ trợ văn bản. Dán hình ảnh, nhận dữ liệu JSON có cấu trúc (OCR, bố cục, ngữ nghĩa).
★ 3.839+83Thay đổi số sao trong 7 ngày qua - #12★ 3.821+0Thay đổi số sao trong 7 ngày qua
- #13
Towhee là một framework chuyên dụng giúp các đường ống xử lý dữ liệu thần kinh trở nên đơn giản và nhanh chóng.
★ 3.453-1Thay đổi số sao trong 7 ngày qua - #14
Các mô hình nền tảng thị giác hiệu quả dành cho việc tạo và nhận diện độ phân giải cao
★ 3.356+1Thay đổi số sao trong 7 ngày qua - #15
InternLM-XComposer2.5-OmniLive: Hệ thống đa phương thức toàn diện cho tương tác video và âm thanh phát streaming thời gian dài
★ 2.925-1Thay đổi số sao trong 7 ngày qua - #16★ 2.695+2Thay đổi số sao trong 7 ngày qua
- #17
[ECCV2024] Video Foundation Models & Data dành cho thấu hiểu đa phương thức
★ 2.374+5Thay đổi số sao trong 7 ngày qua - #18
[CVPR 2025] Triển khai PyTorch chính thức của MambaVision: Một xương sống tầm nhìn Mamba-Transformer lai
★ 2.227+2Thay đổi số sao trong 7 ngày qua - #19
Kho lưu trữ chính thức cho [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" và [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"
★ 2.139+0Thay đổi số sao trong 7 ngày qua - #20
[CVPR 2021] Bản triển khai chính thức trên PyTorch cho Transformer Interpretability Beyond Attention Visualization, một phương pháp mới để trực quan hóa việc phân loại bởi các mạng dựa trên Transformer.
★ 2.014+0Thay đổi số sao trong 7 ngày qua - #21★ 1.955+1Thay đổi số sao trong 7 ngày qua
- #22★ 1.841+2Thay đổi số sao trong 7 ngày qua
- #23
Huấn luyện tất cả trong một cho các mô hình thị giác (YOLO, ViTs, RT-DETR, DINOv3): tiền huấn luyện, tinh chỉnh, chưng cất.
★ 1.656+4Thay đổi số sao trong 7 ngày qua - #24
[ICLR 2023 Spotlight] Vision Transformer Adapter cho dự đoán dày đặc (Dense Predictions)
★ 1.503+1Thay đổi số sao trong 7 ngày qua - #25
Danh sách tổng hợp các mô hình nền tảng cho các tác vụ thị giác máy tính và ngôn ngữ
★ 1.177+0Thay đổi số sao trong 7 ngày qua - #26
UNetFormer: Một transformer kiểu UNet để phân đoạn ngữ nghĩa hiệu quả hình ảnh cảnh quan đô thị viễn thám, ISPRS. Ngoài ra, bao gồm các vision transformer và CNN khác cho việc phân đoạn hình ảnh vệ tinh, hình ảnh trên không và hình ảnh UAV.
★ 1.101+3Thay đổi số sao trong 7 ngày qua - #27
Mô hình biểu diễn tổng quát cho các phương thức thị giác, âm thanh và ngôn ngữ. Bài báo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Thay đổi số sao trong 7 ngày qua - #28
[ICML2025] SpargeAttention: Cơ chế chú ý thưa thớt không cần huấn luyện giúp tăng tốc suy luận của mọi mô hình.
★ 1.045+3Thay đổi số sao trong 7 ngày qua - #29
:fire: :fire: :fire: Danh sách bài báo về một số công trình Thị giác Máy tính (CV) gần đây
★ 973+1Thay đổi số sao trong 7 ngày qua - #30
Kho lưu trữ Vision Transformer với Deformable Attention (CVPR2022) và DAT++: Spatially Dynamic Vision Transformer với Deformable Attention
★ 942+0Thay đổi số sao trong 7 ngày qua