Cuda
Dépôts open source suivis ayant Cuda pour langage principal, triés par étoiles.
- #1llm.c@karpathy
Entraînement de LLM en C/CUDA simple et brut
★ 30 886+44Évolution des étoiles sur les 7 derniers jours - #2instant-ngp@NVlabs
Primitives graphiques neuronales instantanées : NeRF ultra-rapide et plus encore.
★ 17 536+13Évolution des étoiles sur les 7 derniers jours - #3LeetCUDA@xlite-dev
Notes d'apprentissage modernes sur CUDA avec PyTorch pour débutants, incluant plus de 200 noyaux CUDA, Tensor Cores, HGEMM, FA-2 MMA.
★ 11 838+42Évolution des étoiles sur les 7 derniers jours - #4HVM2@HigherOrderCO
Un runtime fonctionnel optimal et massivement parallèle écrit en Rust.
★ 11 340+1Évolution des étoiles sur les 7 derniers jours - #5DeepEP@deepseek-ai
DeepEP : une bibliothèque de communication efficace pour le parallélisme d'experts
★ 10 070+27Évolution des étoiles sur les 7 derniers jours - #6DeepGEMM@deepseek-ai
DeepGEMM : bibliothèque de noyaux BLAS propre et efficace sur GPU
★ 7 743+29Évolution des étoiles sur les 7 derniers jours - #7deep-high-resolution-net.pytorch@leoxiaobin
Implémentation officielle de notre article CVPR2019 "Deep High-Resolution Representation Learning for Human Pose Estimation".
★ 4 480+1Évolution des étoiles sur les 7 derniers jours - #8warp-ctc@baidu-research
CTC parallèle rapide.
★ 4 069+0Évolution des étoiles sur les 7 derniers jours - #9cuda-course@Infatoshi★ 3 980+19Évolution des étoiles sur les 7 derniers jours
- #10SageAttention@thu-ml
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.
★ 3 685+23Évolution des étoiles sur les 7 derniers jours - #11ThunderKittens@HazyResearch
Primitives de tuiles pour des noyaux rapides.
★ 3 658+18Évolution des étoiles sur les 7 derniers jours - #12
Guide d'optimisation d'algorithmes en CUDA.
★ 3 230+17Évolution des étoiles sur les 7 derniers jours - #13AlexNet-Source-Code@computerhistory
Ce paquet contient le code original d'AlexNet de 2012.
★ 2 970+6Évolution des étoiles sur les 7 derniers jours - #14CUDA_Freshman@Tony-Tan★ 2 794+3Évolution des étoiles sur les 7 derniers jours
- #15CUDALibrarySamples@NVIDIA
Exemples de bibliothèque CUDA.
★ 2 488+6Évolution des étoiles sur les 7 derniers jours - #16mirage@mirage-project
Mirage Persistent Kernel : compilation de LLM dans un MegaKernel.
★ 2 461+22Évolution des étoiles sur les 7 derniers jours - #17cugraph@rapidsai
cuGraph - Bibliothèque d'analyse de graphes RAPIDS
★ 2 227+7Évolution des étoiles sur les 7 derniers jours - #18CUDA-Programming@brucefan1983
Exemples de code pour mon livre sur la programmation CUDA
★ 2 091+1Évolution des étoiles sur les 7 derniers jours - #19tsne-cuda@CannyLab
t-SNE accéléré par GPU pour CUDA avec des bindings Python.
★ 1 958+2Évolution des étoiles sur les 7 derniers jours - #20nccl-tests@NVIDIA
Tests NCCL.
★ 1 639+11Évolution des étoiles sur les 7 derniers jours - #21diff-gaussian-rasterization@graphdeco-inria★ 1 489+2Évolution des étoiles sur les 7 derniers jours
- #22torchsparse@mit-han-lab
[MICRO'23, MLSys'22] TorchSparse : Framework d'entraînement et d'inférence efficace pour la convolution creuse sur GPU
★ 1 472+0Évolution des étoiles sur les 7 derniers jours - #23k2@k2-fsa
Algorithmes FSA/FST, différentiables, avec compatibilité PyTorch.
★ 1 352+1Évolution des étoiles sur les 7 derniers jours - #24rtp-llm@alibaba
RTP-LLM : moteur d'inférence LLM haute performance d'Alibaba pour diverses applications.
★ 1 319+6Évolution des étoiles sur les 7 derniers jours - #25SGEMM_CUDA@siboehm
Multiplication de matrices CUDA rapide développée à partir de zéro
★ 1 295+8Évolution des étoiles sur les 7 derniers jours - #26FlashKDA@MoonshotAI
FlashKDA : noyaux d'attention Kimi Delta haute performance.
★ 1 236+8Évolution des étoiles sur les 7 derniers jours - #27flash-attention-minimal@tspeterkim
Flash Attention en environ 100 lignes de CUDA (passe avant uniquement).
★ 1 179+1Évolution des étoiles sur les 7 derniers jours - #28CUDA_Kernel_Samples@Tongkaio
Guide d'implémentation et d'entretien pour les opérateurs CUDA
★ 1 099+7Évolution des étoiles sur les 7 derniers jours - #29cuda-training-series@olcf
Supports de formation associés à la série de formations CUDA de NVIDIA (www.olcf.ornl.gov/cuda-training-series/)
★ 1 043+6Évolution des étoiles sur les 7 derniers jours - #30SpargeAttn@thu-ml
[ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.
★ 1 042+7Évolution des étoiles sur les 7 derniers jours