Cuda
Repositori open source terpantau dengan Cuda sebagai bahasa utama, diurutkan berdasarkan bintang.
- #1llm.c@karpathy
Pelatihan LLM dalam C/CUDA murni yang sederhana
★ 30.886+44Perubahan bintang dalam 7 hari terakhir - #2instant-ngp@NVlabs
Primitif grafis saraf instan: NeRF yang sangat cepat dan banyak lagi.
★ 17.536+13Perubahan bintang dalam 7 hari terakhir - #3LeetCUDA@xlite-dev
Catatan belajar CUDA modern dengan PyTorch untuk pemula, 200+ CUDA Kernel, Tensor Cores, HGEMM, FA-2 MMA.
★ 11.838+42Perubahan bintang dalam 7 hari terakhir - #4HVM2@HigherOrderCO
Runtime fungsional yang optimal dan sangat paralel dalam Rust
★ 11.340+1Perubahan bintang dalam 7 hari terakhir - #5DeepEP@deepseek-ai
DeepEP: pustaka komunikasi expert-parallel yang efisien
★ 10.070+27Perubahan bintang dalam 7 hari terakhir - #6DeepGEMM@deepseek-ai
DeepGEMM: pustaka kernel BLAS yang bersih dan efisien di GPU
★ 7.743+29Perubahan bintang dalam 7 hari terakhir - #7deep-high-resolution-net.pytorch@leoxiaobin
Proyek ini adalah implementasi resmi dari makalah CVPR2019 kami "Deep High-Resolution Representation Learning for Human Pose Estimation"
★ 4.480+1Perubahan bintang dalam 7 hari terakhir - #8warp-ctc@baidu-research
CTC paralel yang cepat.
★ 4.069+0Perubahan bintang dalam 7 hari terakhir - #9cuda-course@Infatoshi★ 3.980+19Perubahan bintang dalam 7 hari terakhir
- #10SageAttention@thu-ml
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention mencapai percepatan 2-5x dibandingkan dengan FlashAttention, tanpa kehilangan metrik end-to-end pada model bahasa, gambar, dan video.
★ 3.683+23Perubahan bintang dalam 7 hari terakhir - #11ThunderKittens@HazyResearch
Primitif tile untuk kernel yang cepat
★ 3.658+18Perubahan bintang dalam 7 hari terakhir - #12
Cara mengoptimalkan algoritma tertentu di CUDA.
★ 3.224+17Perubahan bintang dalam 7 hari terakhir - #13AlexNet-Source-Code@computerhistory
Paket ini berisi kode asli AlexNet tahun 2012.
★ 2.971+6Perubahan bintang dalam 7 hari terakhir - #14CUDA_Freshman@Tony-Tan★ 2.794+3Perubahan bintang dalam 7 hari terakhir
- #15CUDALibrarySamples@NVIDIA
Sampel Pustaka CUDA.
★ 2.489+6Perubahan bintang dalam 7 hari terakhir - #16mirage@mirage-project
Mirage Persistent Kernel: Mengompilasi LLM menjadi MegaKernel.
★ 2.458+22Perubahan bintang dalam 7 hari terakhir - #17cugraph@rapidsai
cuGraph - Pustaka Analisis Grafik RAPIDS
★ 2.227+7Perubahan bintang dalam 7 hari terakhir - #18CUDA-Programming@brucefan1983
Kode contoh untuk buku pemrograman CUDA saya
★ 2.091+1Perubahan bintang dalam 7 hari terakhir - #19tsne-cuda@CannyLab
t-SNE yang dipercepat GPU untuk CUDA dengan binding Python
★ 1.957+2Perubahan bintang dalam 7 hari terakhir - #20nccl-tests@NVIDIA
Uji NCCL
★ 1.639+11Perubahan bintang dalam 7 hari terakhir - #21diff-gaussian-rasterization@graphdeco-inria★ 1.489+2Perubahan bintang dalam 7 hari terakhir
- #22torchsparse@mit-han-lab
[MICRO'23, MLSys'22] TorchSparse: Kerangka Kerja Pelatihan dan Inferensi yang Efisien untuk Konvolusi Jarang pada GPU.
★ 1.472+0Perubahan bintang dalam 7 hari terakhir - #23k2@k2-fsa
Algoritma FSA/FST, terdiferensiasi, dengan kompatibilitas PyTorch.
★ 1.352+1Perubahan bintang dalam 7 hari terakhir - #24rtp-llm@alibaba
RTP-LLM: Mesin inferensi LLM performa tinggi Alibaba untuk berbagai aplikasi.
★ 1.318+6Perubahan bintang dalam 7 hari terakhir - #25SGEMM_CUDA@siboehm
Perkalian matriks CUDA cepat dari awal
★ 1.294+8Perubahan bintang dalam 7 hari terakhir - #26FlashKDA@MoonshotAI
FlashKDA: kernel Kimi Delta Attention berkinerja tinggi
★ 1.231+8Perubahan bintang dalam 7 hari terakhir - #27flash-attention-minimal@tspeterkim
Flash Attention dalam ~100 baris CUDA (hanya forward pass)
★ 1.179+1Perubahan bintang dalam 7 hari terakhir - #28CUDA_Kernel_Samples@Tongkaio
Panduan implementasi manual dan wawancara operator CUDA
★ 1.097+7Perubahan bintang dalam 7 hari terakhir - #29cuda-training-series@olcf
Materi pelatihan yang terkait dengan Seri Pelatihan CUDA NVIDIA (www.olcf.ornl.gov/cuda-training-series/).
★ 1.043+6Perubahan bintang dalam 7 hari terakhir - #30SpargeAttn@thu-ml
[ICML2025] SpargeAttention: Perhatian jarang tanpa pelatihan yang mempercepat inferensi model apa pun.
★ 1.037+7Perubahan bintang dalam 7 hari terakhir