cuda
cuda टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #181
डिस्ट्रीब्यूटेड PyTorch ट्रेनिंग कोड लिखने के तरीके पर सर्वोत्तम अभ्यास और गाइड।
★ 631+2पिछले 7 दिनों में स्टार का बदलाव - #182★ 622+2पिछले 7 दिनों में स्टार का बदलाव
- #183
LuisaCompute पर आधारित उच्च-प्रदर्शन वाला क्रॉस-प्लेटफॉर्म मोंटे कार्लो रेंडरर।
★ 618+1पिछले 7 दिनों में स्टार का बदलाव - #184★ 616+0पिछले 7 दिनों में स्टार का बदलाव
- #185
GPU और अन्य एक्सेलेरेटर के लिए AutoDock
★ 610+1पिछले 7 दिनों में स्टार का बदलाव - #186
OpenAI के Triton का उपयोग करके Python में लिखा गया PyTorch के न्यूरल नेटवर्क मॉड्यूल का एक सबसेट।
★ 604+0पिछले 7 दिनों में स्टार का बदलाव - #187
Windows, Linux, MacOS, Google TV, Stremio, Home Assistant और अन्य (WSL2, GPU ड्राइवर और डेवलपमेंट टूल सहित) को आसानी से कॉन्फ़िगर करने के लिए एक ऐप और गाइड। अपने UX और उत्पादकता में सुधार करें।
★ 602+0पिछले 7 दिनों में स्टार का बदलाव - #188
Go विथ योर ओन इंटेलिजेंस - Go एप्लिकेशन जो हार्डवेयर एक्सेलेरेशन का उपयोग करके स्थानीय इन्फरेंस के लिए सीधे llama.cpp को एकीकृत करते हैं
★ 599+17पिछले 7 दिनों में स्टार का बदलाव - #189
Yet Another Language Model: C++/CUDA में LLM अनुमान, I/O को छोड़कर कोई लाइब्रेरी नहीं
★ 597+1पिछले 7 दिनों में स्टार का बदलाव - #190★ 594+1पिछले 7 दिनों में स्टार का बदलाव
- #191★ 592+0पिछले 7 दिनों में स्टार का बदलाव
- #192
NVIDIA NVSHMEM, OpenSHMEM पर आधारित NVIDIA GPU के लिए एक समानांतर प्रोग्रामिंग इंटरफ़ेस है। NVSHMEM प्रोग्रामर्स को CUDA कर्नेल के भीतर और CUDA स्ट्रीम पर वन-साइडेड संचार करने की अनुमति देकर मल्टी-प्रोसेसर संचार और समन्वय ओवरहेड को काफी कम कर सकता है।
★ 585+4पिछले 7 दिनों में स्टार का बदलाव - #193
Python और C++ के साथ बनाया गया रडार सिम्युलेटर।
★ 576+3पिछले 7 दिनों में स्टार का बदलाव - #194★ 574+0पिछले 7 दिनों में स्टार का बदलाव
- #195
कैंपस प्लेसमेंट, इंटर्नशिप के लिए एक बेहतरीन प्रोजेक्ट, जो आपको शून्य से LLama2/3 और Qwen2.5 का समर्थन करने वाला लार्ज मॉडल इन्फरेंस फ्रेमवर्क बनाना सिखाता है।
★ 574+0पिछले 7 दिनों में स्टार का बदलाव - #196
लार्ज लैंग्वेज मॉडल्स के सफल प्रशिक्षण में मदद करने के लिए कार्यप्रणालियों का एक खुला संग्रह।
★ 569+2पिछले 7 दिनों में स्टार का बदलाव - #197
WMMA API और MMA PTX इंस्ट्रक्शन का उपयोग करके टेन्सर कोर के साथ हाफ-प्रिसिजन जनरल मैट्रिक्स मल्टीप्लिकेशन (HGEMM) की कई ऑप्टिमाइज़ेशन विधियाँ।
★ 568+0पिछले 7 दिनों में स्टार का बदलाव - #198
शून्य से निर्मित LLM डिस्टिलेशन और सर्विंग इंजन: कस्टम Triton/CUDA कर्नेल, FSDP डिस्टिलेशन, पेज्ड-KV कंटीन्यूअस बैचिंग, सट्टा डिकोडिंग, एक Rust गेटवे, एक JAX ओरेकल और व्याख्यात्मकता उपकरण।
★ 566+0पिछले 7 दिनों में स्टार का बदलाव - #199
FlashRT छोटे-बैच, विलंबता-संवेदनशील AI वर्कलोड के लिए एक उच्च-प्रदर्शन रीयल-टाइम इन्फरेंस इंजन है। इसका प्रमुख एकीकरण Pi0, Pi0.5, GROOT N1.6, और Pi0-FAST के लिए प्रोडक्शन VLA नियंत्रण है। यह LLM जैसे qwen3.6-27B को भी सपोर्ट करता है।
★ 562+14पिछले 7 दिनों में स्टार का बदलाव - #200★ 560+1पिछले 7 दिनों में स्टार का बदलाव
- #201
सिद्धांत, समाधान और टेस्ट केस के साथ LLM एल्गोरिदम प्रैक्टिस लैब।
★ 559+20पिछले 7 दिनों में स्टार का बदलाव - #202
Linux पर अपने NVIDIA GPU के VRAM को स्वैप स्पेस के रूप में उपयोग करें। सोल्डेड मेमोरी और बिना अपग्रेड पथ वाले लैपटॉप के लिए बनाया गया है। यदि आपके पास 8GB VRAM वाला RTX कार्ड है और आप SSD पर स्वैप हो रहे हैं, तो यह उस VRAM को काम में लगाता है
★ 555+4पिछले 7 दिनों में स्टार का बदलाव - #203★ 552+2पिछले 7 दिनों में स्टार का बदलाव
- #204
docker-compose का उपयोग करने वाला एक Slurm क्लस्टर।
★ 544+2पिछले 7 दिनों में स्टार का बदलाव - #205★ 532+0पिछले 7 दिनों में स्टार का बदलाव
- #206
PyTorch में Holistically-Nested Edge Detection का पुन: कार्यान्वयन
★ 525+0पिछले 7 दिनों में स्टार का बदलाव - #207★ 518-1पिछले 7 दिनों में स्टार का बदलाव
- #208★ 518+0पिछले 7 दिनों में स्टार का बदलाव
- #209
Ubuntu Desktop के लिए Docker इमेज जो HW GPU त्वरित GUI ऐप्स का समर्थन करती है। आप Cloud VM की तरह ही ssh या रिमोट डेस्कटॉप के साथ कंटेनर तक पहुँच सकते हैं।
★ 515+0पिछले 7 दिनों में स्टार का बदलाव - #210
यह रिपॉजिटरी कुछ बेहतरीन सार्वजनिक CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX और High Performance Computing (HPC) प्रोजेक्ट्स की सूची है।
★ 512+0पिछले 7 दिनों में स्टार का बदलाव