Cuda
Cuda を第一言語とする追跡中のオープンソースリポジトリを、スター数順に表示します。
- #1llm.c@karpathy
シンプルで生のC/CUDAによるLLMトレーニング。
★ 30,886+44直近 7 日のスター増減 - #2instant-ngp@NVlabs
インスタントなニューラルグラフィックスプリミティブ:超高速NeRFなど
★ 17,536+13直近 7 日のスター増減 - #3LeetCUDA@xlite-dev
初心者向けのモダンなCUDA学習ノート(PyTorch使用)、200以上のCUDAカーネル、Tensor Cores、HGEMM、FA-2 MMA。
★ 11,838+42直近 7 日のスター増減 - #4HVM2@HigherOrderCO
Rustにおける大規模並列・最適な関数型ランタイム
★ 11,340+1直近 7 日のスター増減 - #5DeepEP@deepseek-ai
DeepEP: 高効率なエキスパート並列通信ライブラリ
★ 10,070+27直近 7 日のスター増減 - #6DeepGEMM@deepseek-ai
DeepGEMM: GPU上でのクリーンで効率的なBLASカーネルライブラリ
★ 7,743+29直近 7 日のスター増減 - #7deep-high-resolution-net.pytorch@leoxiaobin
本プロジェクトは、我々のCVPR2019論文「Deep High-Resolution Representation Learning for Human Pose Estimation」の公式実装である。
★ 4,480+1直近 7 日のスター増減 - #8warp-ctc@baidu-research
高速並列CTC。
★ 4,069+0直近 7 日のスター増減 - #9cuda-course@Infatoshi★ 3,980+19直近 7 日のスター増減
- #10SageAttention@thu-ml
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量子化アテンションにより、言語、画像、動画モデルのエンドツーエンドの指標を落とすことなく、FlashAttentionと比較して2〜5倍の高速化を実現
★ 3,683+23直近 7 日のスター増減 - #11ThunderKittens@HazyResearch
高速カーネルのためのタイルプリミティブ
★ 3,658+18直近 7 日のスター増減 - #12
CUDA におけるいくつかのアルゴリズムを最適化する方法
★ 3,224+17直近 7 日のスター増減 - #13AlexNet-Source-Code@computerhistory
このパッケージには、オリジナルの 2012 年製 AlexNet コードが含まれています。
★ 2,971+6直近 7 日のスター増減 - #14CUDA_Freshman@Tony-Tan★ 2,794+3直近 7 日のスター増減
- #15CUDALibrarySamples@NVIDIA
CUDAライブラリのサンプル
★ 2,489+6直近 7 日のスター増減 - #16mirage@mirage-project
Mirage Persistent Kernel: LLM を MegaKernel にコンパイルする
★ 2,458+22直近 7 日のスター増減 - #17cugraph@rapidsai
cuGraph - RAPIDS グラフ解析ライブラリ
★ 2,227+7直近 7 日のスター増減 - #18CUDA-Programming@brucefan1983
CUDA プログラミング書籍のサンプルコード
★ 2,091+1直近 7 日のスター増減 - #19tsne-cuda@CannyLab
Python バインディングを備えた CUDA 向けの GPU 高速化 t-SNE
★ 1,957+2直近 7 日のスター増減 - #20nccl-tests@NVIDIA
NCCL テスト
★ 1,639+11直近 7 日のスター増減 - #21diff-gaussian-rasterization@graphdeco-inria★ 1,489+2直近 7 日のスター増減
- #22torchsparse@mit-han-lab
[MICRO'23, MLSys'22] TorchSparse: GPU 上でのスパース畳み込みに向けた効率的な学習および推論フレームワーク
★ 1,472+0直近 7 日のスター増減 - #23k2@k2-fsa
PyTorch互換性を持つ微分可能なFSA/FSTアルゴリズム。
★ 1,352+1直近 7 日のスター増減 - #24rtp-llm@alibaba
RTP-LLM: 多様な用途に向けた Alibaba の高性能 LLM 推論エンジン
★ 1,318+6直近 7 日のスター増減 - #25SGEMM_CUDA@siboehm
スクラッチから実装した高速なCUDA行列乗算。
★ 1,294+8直近 7 日のスター増減 - #26FlashKDA@MoonshotAI
FlashKDA: 高性能な Kimi Delta Attention カーネル
★ 1,231+8直近 7 日のスター増減 - #27flash-attention-minimal@tspeterkim
約100行の CUDA で実装された Flash Attention(フォワードパスのみ)
★ 1,179+1直近 7 日のスター増減 - #28CUDA_Kernel_Samples@Tongkaio
CUDA オペレータの実装と面接ガイド
★ 1,097+7直近 7 日のスター増減 - #29cuda-training-series@olcf
NVIDIAのCUDAトレーニングシリーズ(www.olcf.ornl.gov/cuda-training-series/)に関連するトレーニング資料
★ 1,043+6直近 7 日のスター増減 - #30SpargeAttn@thu-ml
[ICML2025] SpargeAttention: あらゆるモデルの推論を加速する、トレーニング不要のスパースアテンション
★ 1,037+7直近 7 日のスター増減