メインコンテンツへスキップ
Github-star-radar
言語 · Cuda

Cuda

Cuda を第一言語とする追跡中のオープンソースリポジトリを、スター数順に表示します。

61 件のリポジトリ
  • llm.c@karpathy

    シンプルで生のC/CUDAによるLLMトレーニング。

    30,886+44直近 7 日のスター増減
  • instant-ngp@NVlabs

    インスタントなニューラルグラフィックスプリミティブ:超高速NeRFなど

    17,536+13直近 7 日のスター増減
  • LeetCUDA@xlite-dev

    初心者向けのモダンなCUDA学習ノート(PyTorch使用)、200以上のCUDAカーネル、Tensor Cores、HGEMM、FA-2 MMA。

    11,838+42直近 7 日のスター増減
  • HVM2@HigherOrderCO

    Rustにおける大規模並列・最適な関数型ランタイム

    11,340+1直近 7 日のスター増減
  • DeepEP@deepseek-ai

    DeepEP: 高効率なエキスパート並列通信ライブラリ

    10,070+27直近 7 日のスター増減
  • DeepGEMM@deepseek-ai

    DeepGEMM: GPU上でのクリーンで効率的なBLASカーネルライブラリ

    7,743+29直近 7 日のスター増減
  • 本プロジェクトは、我々のCVPR2019論文「Deep High-Resolution Representation Learning for Human Pose Estimation」の公式実装である。

    4,480+1直近 7 日のスター増減
  • warp-ctc@baidu-research

    高速並列CTC。

    4,069+0直近 7 日のスター増減
  • cuda-course@Infatoshi
    3,980+19直近 7 日のスター増減
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量子化アテンションにより、言語、画像、動画モデルのエンドツーエンドの指標を落とすことなく、FlashAttentionと比較して2〜5倍の高速化を実現

    3,683+23直近 7 日のスター増減
  • ThunderKittens@HazyResearch

    高速カーネルのためのタイルプリミティブ

    3,658+18直近 7 日のスター増減
  • CUDA におけるいくつかのアルゴリズムを最適化する方法

    3,224+17直近 7 日のスター増減
  • AlexNet-Source-Code@computerhistory

    このパッケージには、オリジナルの 2012 年製 AlexNet コードが含まれています。

    2,971+6直近 7 日のスター増減
  • CUDA_Freshman@Tony-Tan
    2,794+3直近 7 日のスター増減
  • CUDAライブラリのサンプル

    2,489+6直近 7 日のスター増減
  • mirage@mirage-project

    Mirage Persistent Kernel: LLM を MegaKernel にコンパイルする

    2,458+22直近 7 日のスター増減
  • cugraph@rapidsai

    cuGraph - RAPIDS グラフ解析ライブラリ

    2,227+7直近 7 日のスター増減
  • CUDA-Programming@brucefan1983

    CUDA プログラミング書籍のサンプルコード

    2,091+1直近 7 日のスター増減
  • tsne-cuda@CannyLab

    Python バインディングを備えた CUDA 向けの GPU 高速化 t-SNE

    1,957+2直近 7 日のスター増減
  • nccl-tests@NVIDIA

    NCCL テスト

    1,639+11直近 7 日のスター増減
  • diff-gaussian-rasterization@graphdeco-inria
    1,489+2直近 7 日のスター増減
  • torchsparse@mit-han-lab

    [MICRO'23, MLSys'22] TorchSparse: GPU 上でのスパース畳み込みに向けた効率的な学習および推論フレームワーク

    1,472+0直近 7 日のスター増減
  • k2@k2-fsa

    PyTorch互換性を持つ微分可能なFSA/FSTアルゴリズム。

    1,352+1直近 7 日のスター増減
  • rtp-llm@alibaba

    RTP-LLM: 多様な用途に向けた Alibaba の高性能 LLM 推論エンジン

    1,318+6直近 7 日のスター増減
  • SGEMM_CUDA@siboehm

    スクラッチから実装した高速なCUDA行列乗算。

    1,294+8直近 7 日のスター増減
  • FlashKDA@MoonshotAI

    FlashKDA: 高性能な Kimi Delta Attention カーネル

    1,231+8直近 7 日のスター増減
  • 約100行の CUDA で実装された Flash Attention(フォワードパスのみ)

    1,179+1直近 7 日のスター増減
  • CUDA_Kernel_Samples@Tongkaio

    CUDA オペレータの実装と面接ガイド

    1,097+7直近 7 日のスター増減
  • NVIDIAのCUDAトレーニングシリーズ(www.olcf.ornl.gov/cuda-training-series/)に関連するトレーニング資料

    1,043+6直近 7 日のスター増減
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: あらゆるモデルの推論を加速する、トレーニング不要のスパースアテンション

    1,037+7直近 7 日のスター増減
← 言語一覧に戻る