跳到主要内容
buildradar
Sign in
主题 · vision-transformer

vision-transformer

标记 vision-transformer 主题、收录中的开源项目,按星标数排序。

项目数
45
总星标数
154,486
平均星标数
3,433
占比
0.01%

常跟 vision-transformer 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 vision-transformer 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • mmdetection@open-mmlab

    OpenMMLab 检测工具箱与基准测试

    32,901+6近 7 天星标变化
  • LaTeX-OCR@lukas-blecher

    pix2tex:使用 ViT 将方程式图片转换为 LaTeX 代码

    16,549+0近 7 天星标变化
  • Transformers-Tutorials@NielsRogge

    此仓库包含我使用 HuggingFace 的 Transformers 库制作的示例。

    11,748+0近 7 天星标变化
  • VAR@FoundationVision

    [NeurIPS 2024 最佳论文奖][GPT 打败 diffusion🔥] [视觉生成的 scaling laws📈] 官方实现“Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction”——一个*超简洁、用户友好且达到最先进水平*的自回归图像生成代码库

    8,728-1近 7 天星标变化
  • omniparse@adithya-s-k

    获取、解析并优化任何数据格式 ➡️ 从文档到多媒体 ➡️ 提升与 GenAI 框架的兼容性

    7,823+4近 7 天星标变化
  • SwinIR@JingyunLiang

    SwinIR:使用 Swin Transformer 的图像恢复(官方仓库)。

    5,586+6近 7 天星标变化
  • mlx-vlm@Blaizzy

    MLX-VLM 是一个在 Mac 上使用 MLX 进行 Vision Language Models (VLMs) 推理与微调的套件

    5,462+25近 7 天星标变化
  • 一份全面的 Vision Transformer/Attention 论文清单,包含论文、代码与相关网站

    5,046-3近 7 天星标变化
  • Efficient-AI-Backbones@huawei-noah

    高效 AI 主干网络,包括 GhostNet、TNT 与 MLP,由华为 Noah's Ark Lab 开发。

    4,419+1近 7 天星标变化
  • mmpretrain@open-mmlab

    OpenMMLab 预训练工具箱与基准测试

    3,850-1近 7 天星标变化
  • modlens@liustack

    DeepSeek Harness 的第一个视觉插件,以及每个纯文字编码代理的视觉桥接。粘贴图片,即可获得结构化 JSON 证据(OCR、版面、语义)。 | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

    3,839+83近 7 天星标变化
  • scenic@google-research

    Scenic:一个用于计算机视觉研究及更广泛应用的Jax库

    3,821+0近 7 天星标变化
  • towhee@towhee-io

    Towhee 是一个致力于简化神经数据处理流水线的框架

    3,453-1近 7 天星标变化
  • efficientvit@mit-han-lab

    高效的视觉基础模型,用于高分辨率生成与感知。

    3,356+1近 7 天星标变化
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:一个全面的多模态系统,用于长期串流视频与音频互动

    2,925-1近 7 天星标变化
  • EVA@baaivision

    EVA 系列:来自 BAAI 的视觉表示幻想

    2,695+2近 7 天星标变化
  • InternVideo@OpenGVLab

    [ECCV2024] 用于多模态理解的视频基础模型与数据

    2,374+5近 7 天星标变化
  • MambaVision@NVlabs

    [CVPR 2025] MambaVision 官方 PyTorch 实现:混合 Mamba-Transformer 视觉骨干网络

    2,227+2近 7 天星标变化
  • ViTPose@ViTAE-Transformer

    [NeurIPS'22]“ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation”与 [TPAMI'23]“ViTPose++: Vision Transformer for Generic Body Pose Estimation”的官方代码库

    2,139+0近 7 天星标变化
  • Transformer-Explainability@hila-chefer

    [CVPR 2021] Transformer 解释超越注意力可视化的官方 PyTorch 实现,这是一种基于 Transformer 网络将分类可视化的新颖方法。

    2,014+0近 7 天星标变化
  • EasyCV@alibaba

    一个全方位的计算机视觉工具包

    1,955+1近 7 天星标变化
  • Cream@microsoft

    这是我们关于 NAS 与 Vision Transformer 工作的集合。

    1,841+2近 7 天星标变化
  • lightly-train@lightly-ai

    视觉模型的一站式训练(YOLO、ViTs、RT-DETR、DINOv3):预训练、微调、蒸馏。

    1,656+4近 7 天星标变化
  • ViT-Adapter@czczup

    [ICLR 2023 Spotlight] 用于密集预测的 Vision Transformer Adapter

    1,503+1近 7 天星标变化
  • 精选的视觉与语言任务基础模型清单

    1,177+0近 7 天星标变化
  • GeoSeg@WangLibo1995

    UNetFormer:用于遥感城市场景影像高效语义分割的类 UNet transformer,ISPRS。同时包含用于卫星、航空影像及无人机影像分割的其他视觉 transformer 与 CNN。

    1,101+3近 7 天星标变化
  • ONE-PEACE@OFA-Sys

    跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0近 7 天星标变化
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention:一种无需训练的稀疏注意力机制,可加速任何模型的推理。

    1,047+4近 7 天星标变化
  • :fire: :fire: :fire: 近期计算机视觉 (CV) 相关论文列表

    973+1近 7 天星标变化
  • DAT@LeapLabTHU

    带有可变形注意力的 Vision Transformer(CVPR2022)与 DAT++ 存储库:具备可变形注意力的空间动态 Vision Transformer

    944+1近 7 天星标变化
← 返回主题列表