vision-transformer
标记 vision-transformer 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 vision-transformer 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 vision-transformer 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
OpenMMLab 检测工具箱与基准测试
★ 32,901+6近 7 天星标变化 - #2★ 16,549+0近 7 天星标变化
- #3
此仓库包含我使用 HuggingFace 的 Transformers 库制作的示例。
★ 11,748+0近 7 天星标变化 - #4
[NeurIPS 2024 最佳论文奖][GPT 打败 diffusion🔥] [视觉生成的 scaling laws📈] 官方实现“Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction”——一个*超简洁、用户友好且达到最先进水平*的自回归图像生成代码库
★ 8,728-1近 7 天星标变化 - #5★ 7,823+4近 7 天星标变化
- #6★ 5,586+6近 7 天星标变化
- #7★ 5,462+25近 7 天星标变化
- #8
一份全面的 Vision Transformer/Attention 论文清单,包含论文、代码与相关网站
★ 5,046-3近 7 天星标变化 - #9
高效 AI 主干网络,包括 GhostNet、TNT 与 MLP,由华为 Noah's Ark Lab 开发。
★ 4,419+1近 7 天星标变化 - #10
OpenMMLab 预训练工具箱与基准测试
★ 3,850-1近 7 天星标变化 - #11
DeepSeek Harness 的第一个视觉插件,以及每个纯文字编码代理的视觉桥接。粘贴图片,即可获得结构化 JSON 证据(OCR、版面、语义)。 | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 3,839+83近 7 天星标变化 - #12★ 3,821+0近 7 天星标变化
- #13★ 3,453-1近 7 天星标变化
- #14
高效的视觉基础模型,用于高分辨率生成与感知。
★ 3,356+1近 7 天星标变化 - #15
InternLM-XComposer2.5-OmniLive:一个全面的多模态系统,用于长期串流视频与音频互动
★ 2,925-1近 7 天星标变化 - #16★ 2,695+2近 7 天星标变化
- #17
[ECCV2024] 用于多模态理解的视频基础模型与数据
★ 2,374+5近 7 天星标变化 - #18
[CVPR 2025] MambaVision 官方 PyTorch 实现:混合 Mamba-Transformer 视觉骨干网络
★ 2,227+2近 7 天星标变化 - #19
[NeurIPS'22]“ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation”与 [TPAMI'23]“ViTPose++: Vision Transformer for Generic Body Pose Estimation”的官方代码库
★ 2,139+0近 7 天星标变化 - #20
[CVPR 2021] Transformer 解释超越注意力可视化的官方 PyTorch 实现,这是一种基于 Transformer 网络将分类可视化的新颖方法。
★ 2,014+0近 7 天星标变化 - #21★ 1,955+1近 7 天星标变化
- #22★ 1,841+2近 7 天星标变化
- #23
视觉模型的一站式训练(YOLO、ViTs、RT-DETR、DINOv3):预训练、微调、蒸馏。
★ 1,656+4近 7 天星标变化 - #24
[ICLR 2023 Spotlight] 用于密集预测的 Vision Transformer Adapter
★ 1,503+1近 7 天星标变化 - #25
精选的视觉与语言任务基础模型清单
★ 1,177+0近 7 天星标变化 - #26
UNetFormer:用于遥感城市场景影像高效语义分割的类 UNet transformer,ISPRS。同时包含用于卫星、航空影像及无人机影像分割的其他视觉 transformer 与 CNN。
★ 1,101+3近 7 天星标变化 - #27
跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0近 7 天星标变化 - #28
[ICML2025] SpargeAttention:一种无需训练的稀疏注意力机制,可加速任何模型的推理。
★ 1,047+4近 7 天星标变化 - #29
:fire: :fire: :fire: 近期计算机视觉 (CV) 相关论文列表
★ 973+1近 7 天星标变化 - #30★ 944+1近 7 天星标变化