vision-transformer
vision-transformer がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
vision-transformer と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、vision-transformer がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
OpenMMLab Detection ToolboxおよびBenchmark。
★ 32,901+6直近 7 日のスター増減 - #2★ 16,549+0直近 7 日のスター増減
- #3
このリポジトリには、HuggingFaceのTransformersライブラリを使用して作成したデモが含まれています。
★ 11,748+0直近 7 日のスター増減 - #4
[NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [visual generationにおけるスケーリング則📈] 「Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction」の公式実装。自己回帰型画像生成のための*超シンプルでユーザーフレンドリーながら最先端*のコードベース!
★ 8,728-1直近 7 日のスター増減 - #5★ 7,823+4直近 7 日のスター増減
- #6★ 5,586+6直近 7 日のスター増減
- #7★ 5,462+25直近 7 日のスター増減
- #8
Vision Transformer/Attentionに関する究極的に包括的な論文リスト。論文、コード、関連ウェブサイトを含む。
★ 5,046-3直近 7 日のスター増減 - #9
Huawei Noah's Ark Labによって開発された、GhostNet、TNT、MLPを含む効率的なAIバックボーン
★ 4,419+1直近 7 日のスター増減 - #10
OpenMMLabの事前学習用ツールボックスおよびベンチマーク
★ 3,850-1直近 7 日のスター増減 - #11
DeepSeek Harness 向けの最初のビジョンプラグインであり、すべてのテキスト専用コーディングエージェントのためのビジョンブリッジ。画像を貼り付けるだけで、構造化された JSON のエビデンス(OCR、レイアウト、セマンティクス)を取得できます。
★ 3,839+83直近 7 日のスター増減 - #12★ 3,821+0直近 7 日のスター増減
- #13★ 3,453-1直近 7 日のスター増減
- #14
高解像度の生成と認識に向けた効率的なビジョン基盤モデル。
★ 3,356+1直近 7 日のスター増減 - #15
InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。
★ 2,925-1直近 7 日のスター増減 - #16★ 2,695+2直近 7 日のスター増減
- #17
[ECCV2024] マルチモーダル理解のためのビデオ基盤モデルとデータ
★ 2,374+5直近 7 日のスター増減 - #18
[CVPR 2025] MambaVision の公式 PyTorch 実装:ハイブリッド Mamba-Transformer ビジョンバックボーン
★ 2,227+2直近 7 日のスター増減 - #19
[NeurIPS'22] 「ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation」および [TPAMI'23] 「ViTPose++: Vision Transformer for Generic Body Pose Estimation」の公式リポジトリ
★ 2,139+0直近 7 日のスター増減 - #20
[CVPR 2021] Transformerベースのネットワークによる分類を視覚化する新しい手法「Transformer Interpretability Beyond Attention Visualization」の公式PyTorch実装
★ 2,014+0直近 7 日のスター増減 - #21★ 1,955+1直近 7 日のスター増減
- #22★ 1,841+2直近 7 日のスター増減
- #23
ビジョンモデル(YOLO、ViTs、RT-DETR、DINOv3)向けのオールインワン学習:事前学習、ファインチューニング、蒸留。
★ 1,656+4直近 7 日のスター増減 - #24
[ICLR 2023 Spotlight] 密な予測のための Vision Transformer アダプター
★ 1,503+1直近 7 日のスター増減 - #25
ビジョンおよび言語タスク向け基盤モデルのキュレーションリスト
★ 1,177+0直近 7 日のスター増減 - #26
UNetFormer: リモートセンシング都市シーン画像の効率的なセマンティックセグメンテーションのためのUNetライクなトランスフォーマー(ISPRS)。また、衛星、航空、UAV画像セグメンテーション用の他のVision TransformerやCNNも含みます。
★ 1,101+3直近 7 日のスター増減 - #27
ビジョン、オーディオ、言語モダリティを横断する汎用表現モデル。論文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0直近 7 日のスター増減 - #28
[ICML2025] SpargeAttention: あらゆるモデルの推論を加速する、トレーニング不要のスパースアテンション
★ 1,046+3直近 7 日のスター増減 - #29
:fire: :fire: :fire: 最近の Computer Vision (CV) に関する論文リスト
★ 973+1直近 7 日のスター増減 - #30
Deformable Attention を用いた Vision Transformer (CVPR2022) および DAT++: Spatially Dynamic Vision Transformer with Deformable Attention のリポジトリ
★ 943+0直近 7 日のスター増減