Cuda
ट्रैक की गई वे ओपन सोर्स रिपॉजिटरी जिनकी मुख्य भाषा Cuda है, स्टार के हिसाब से क्रमबद्ध।
- #1llm.c@karpathy
सरल, रॉ C/CUDA में LLM ट्रेनिंग
★ 30,886+44पिछले 7 दिनों में स्टार का बदलाव - #2instant-ngp@NVlabs
Instant neural graphics primitives: बिजली की तरह तेज़ NeRF और बहुत कुछ
★ 17,536+13पिछले 7 दिनों में स्टार का बदलाव - #3LeetCUDA@xlite-dev
शुरुआती लोगों के लिए PyTorch के साथ आधुनिक CUDA लर्निंग नोट्स, 200+ CUDA कर्नेल, Tensor Cores, HGEMM, FA-2 MMA।
★ 11,838+42पिछले 7 दिनों में स्टार का बदलाव - #4HVM2@HigherOrderCO
Rust में एक बड़े पैमाने पर समानांतर, इष्टतम कार्यात्मक रनटाइम
★ 11,340+1पिछले 7 दिनों में स्टार का बदलाव - #5DeepEP@deepseek-ai
DeepEP: एक कुशल एक्सपर्ट-पैरेलल कम्युनिकेशन लाइब्रेरी
★ 10,070+27पिछले 7 दिनों में स्टार का बदलाव - #6DeepGEMM@deepseek-ai
DeepGEMM: GPU पर साफ और कुशल BLAS कर्नेल लाइब्रेरी
★ 7,743+29पिछले 7 दिनों में स्टार का बदलाव - #7deep-high-resolution-net.pytorch@leoxiaobin
यह प्रोजेक्ट हमारे CVPR2019 पेपर "Deep High-Resolution Representation Learning for Human Pose Estimation" का आधिकारिक कार्यान्वयन है
★ 4,480+1पिछले 7 दिनों में स्टार का बदलाव - #8warp-ctc@baidu-research
तेज़ समानांतर CTC।
★ 4,069+0पिछले 7 दिनों में स्टार का बदलाव - #9cuda-course@Infatoshi★ 3,980+19पिछले 7 दिनों में स्टार का बदलाव
- #10SageAttention@thu-ml
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention भाषा, छवि और वीडियो मॉडल में एंड-टू-एंड मेट्रिक्स खोए बिना FlashAttention की तुलना में 2-5x गति प्राप्त करता है।
★ 3,683+23पिछले 7 दिनों में स्टार का बदलाव - #11ThunderKittens@HazyResearch
तेज़ कर्नेल के लिए टाइल प्रिमिटिव्स
★ 3,658+18पिछले 7 दिनों में स्टार का बदलाव - #12
cuda में कुछ एल्गोरिदम को कैसे अनुकूलित करें।
★ 3,224+17पिछले 7 दिनों में स्टार का बदलाव - #13AlexNet-Source-Code@computerhistory
इस पैकेज में मूल 2012 AlexNet कोड शामिल है।
★ 2,971+6पिछले 7 दिनों में स्टार का बदलाव - #14CUDA_Freshman@Tony-Tan★ 2,794+3पिछले 7 दिनों में स्टार का बदलाव
- #15CUDALibrarySamples@NVIDIA
CUDA लाइब्रेरी सैंपल
★ 2,489+6पिछले 7 दिनों में स्टार का बदलाव - #16mirage@mirage-project
Mirage Persistent Kernel: LLM को MegaKernel में कंपाइल करना
★ 2,458+22पिछले 7 दिनों में स्टार का बदलाव - #17cugraph@rapidsai
cuGraph - RAPIDS ग्राफ एनालिटिक्स लाइब्रेरी
★ 2,227+7पिछले 7 दिनों में स्टार का बदलाव - #18CUDA-Programming@brucefan1983
मेरी CUDA प्रोग्रामिंग पुस्तक के लिए नमूना कोड
★ 2,091+1पिछले 7 दिनों में स्टार का बदलाव - #19tsne-cuda@CannyLab
पाइथन बाइंडिंग के साथ CUDA के लिए GPU त्वरित t-SNE
★ 1,957+2पिछले 7 दिनों में स्टार का बदलाव - #20nccl-tests@NVIDIA
NCCL परीक्षण
★ 1,639+11पिछले 7 दिनों में स्टार का बदलाव - #21diff-gaussian-rasterization@graphdeco-inria★ 1,489+2पिछले 7 दिनों में स्टार का बदलाव
- #22torchsparse@mit-han-lab
[MICRO'23, MLSys'22] TorchSparse: GPU पर स्पार्स कनवॉल्यूशन के लिए कुशल प्रशिक्षण और अनुमान फ्रेमवर्क।
★ 1,472+0पिछले 7 दिनों में स्टार का बदलाव - #23k2@k2-fsa
FSA/FST एल्गोरिदम, भिन्ननीय, PyTorch संगतता के साथ।
★ 1,352+1पिछले 7 दिनों में स्टार का बदलाव - #24rtp-llm@alibaba
RTP-LLM: विभिन्न अनुप्रयोगों के लिए Alibaba का उच्च-प्रदर्शन LLM इन्फेरेंस इंजन।
★ 1,318+6पिछले 7 दिनों में स्टार का बदलाव - #25SGEMM_CUDA@siboehm
शुरुआत से तेज CUDA मैट्रिक्स मल्टीप्लिकेशन।
★ 1,294+8पिछले 7 दिनों में स्टार का बदलाव - #26FlashKDA@MoonshotAI
FlashKDA: उच्च-प्रदर्शन Kimi Delta Attention कर्नेल
★ 1,231+8पिछले 7 दिनों में स्टार का बदलाव - #27flash-attention-minimal@tspeterkim
~100 लाइनों के CUDA में Flash Attention (केवल फॉरवर्ड पास)
★ 1,179+1पिछले 7 दिनों में स्टार का बदलाव - #28CUDA_Kernel_Samples@Tongkaio
CUDA ऑपरेटर हस्त-लिखित और साक्षात्कार गाइड
★ 1,097+7पिछले 7 दिनों में स्टार का बदलाव - #29cuda-training-series@olcf
NVIDIA की CUDA ट्रेनिंग सीरीज़ (www.olcf.ornl.gov/cuda-training-series/) से संबंधित प्रशिक्षण सामग्री।
★ 1,043+6पिछले 7 दिनों में स्टार का बदलाव - #30SpargeAttn@thu-ml
[ICML2025] SpargeAttention: एक ट्रेनिंग-मुक्त स्पार्स अटेंशन जो किसी भी मॉडल के इन्फॉरेंस को गति देता है।
★ 1,037+7पिछले 7 दिनों में स्टार का बदलाव