cuda
Repositori open source terpantau bertanda cuda, diurutkan berdasarkan bintang.
- #181
Praktik terbaik & panduan tentang cara menulis kode pelatihan pytorch terdistribusi
★ 631+2Perubahan bintang dalam 7 hari terakhir - #182★ 622+2Perubahan bintang dalam 7 hari terakhir
- #183
Renderer Monte Carlo lintas platform berkinerja tinggi berbasis LuisaCompute.
★ 618+1Perubahan bintang dalam 7 hari terakhir - #184★ 616+0Perubahan bintang dalam 7 hari terakhir
- #185
AutoDock untuk GPU dan akselerator lainnya
★ 610+1Perubahan bintang dalam 7 hari terakhir - #186
Sebagian kecil modul neural network PyTorch, ditulis dalam Python menggunakan Triton dari OpenAI.
★ 604+0Perubahan bintang dalam 7 hari terakhir - #187
Aplikasi dan panduan untuk mengonfigurasi Windows, Linux, MacOS, Google TV, Stremio, Home Assistant, dan lainnya dengan mudah (termasuk WSL2, driver GPU, & alat pengembangan). Tingkatkan UX & produktivitas Anda.
★ 602+0Perubahan bintang dalam 7 hari terakhir - #188
Gunakan kecerdasan Anda sendiri - Aplikasi Go yang secara langsung mengintegrasikan llama.cpp untuk inferensi lokal menggunakan akselerasi perangkat keras.
★ 599+17Perubahan bintang dalam 7 hari terakhir - #189
Yet Another Language Model: Inferensi LLM dalam C++/CUDA, tanpa pustaka kecuali untuk I/O
★ 597+1Perubahan bintang dalam 7 hari terakhir - #190★ 594+1Perubahan bintang dalam 7 hari terakhir
- #191★ 592+0Perubahan bintang dalam 7 hari terakhir
- #192
NVIDIA NVSHMEM adalah antarmuka pemrogram pararel untuk GPU NVIDIA yang berbasis pada OpenSHMEM. NVSHMEM dapat secara signifikan mengurangi komunikasi multi-proses dan overhead koordinasi dengan memungkinkan programmer melakukan komunikasi satu sisi dari dalam kernel CUDA dan pada stream CUDA.
★ 585+4Perubahan bintang dalam 7 hari terakhir - #193
Simulator Radar yang dibangun dengan Python dan C++
★ 576+3Perubahan bintang dalam 7 hari terakhir - #194
Proyek bagus untuk rekrutmen kampus, rekrutmen musim gugur, musim semi, dan magang, membimbing Anda membangun kerangka kerja inferensi model besar dari awal yang mendukung LLama2/3 dan Qwen2.5.
★ 574+0Perubahan bintang dalam 7 hari terakhir - #195
Pustaka C++ single-header untuk menyederhanakan penggunaan CUDA Runtime Compilation (NVRTC).
★ 574+0Perubahan bintang dalam 7 hari terakhir - #196
Kumpulan metodologi terbuka untuk membantu pelatihan model bahasa besar (LLM) secara sukses.
★ 569+2Perubahan bintang dalam 7 hari terakhir - #197
Beberapa metode optimasi perkalian matriks umum presisi setengah (HGEMM) menggunakan tensor core dengan API WMMA dan instruksi MMA PTX.
★ 568+0Perubahan bintang dalam 7 hari terakhir - #198
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 566+0Perubahan bintang dalam 7 hari terakhir - #199
FlashRT adalah mesin inferensi waktu nyata berkinerja tinggi untuk beban kerja AI batch kecil yang sensitif terhadap latensi. Integrasi utamanya adalah kontrol VLA produksi untuk Pi0, Pi0.5, GROOT N1.6, dan Pi0-FAST. Juga mendukung LLM seperti qwen3.6-27B
★ 562+14Perubahan bintang dalam 7 hari terakhir - #200★ 560+1Perubahan bintang dalam 7 hari terakhir
- #201
Laboratorium latihan algoritma LLM dengan teori, solusi, dan kasus uji. Tutorial praktik algoritma dari tingkat dasar hingga tingkat lanjut untuk Model Besar, mencakup penjelasan prinsip, analisis jawaban, kasus uji, dan praktik CUDA/Triton.
★ 559+20Perubahan bintang dalam 7 hari terakhir - #202
Gunakan VRAM GPU NVIDIA Anda sebagai ruang swap di Linux. Dibuat untuk laptop dengan memori yang disolder dan tidak bisa diupgrade. Jika Anda memiliki kartu RTX dengan VRAM 8GB yang menganggur dan sistem melakukan swap ke SSD, ini akan memanfaatkan VRAM tersebut.
★ 555+4Perubahan bintang dalam 7 hari terakhir - #203★ 552+2Perubahan bintang dalam 7 hari terakhir
- #204
Sebuah cluster Slurm menggunakan docker-compose
★ 544+2Perubahan bintang dalam 7 hari terakhir - #205★ 532+0Perubahan bintang dalam 7 hari terakhir
- #206
Implementasi ulang Holistically-Nested Edge Detection di PyTorch
★ 525+0Perubahan bintang dalam 7 hari terakhir - #207★ 518-1Perubahan bintang dalam 7 hari terakhir
- #208★ 518+0Perubahan bintang dalam 7 hari terakhir
- #209
Docker Image untuk Ubuntu Desktop yang mendukung aplikasi GUI dengan akselerasi GPU perangkat keras. Anda dapat mengakses Container menggunakan SSH atau remote desktop, seperti halnya Cloud VM.
★ 515+0Perubahan bintang dalam 7 hari terakhir - #210
🚀🚀🚀 Repositori ini mencantumkan beberapa proyek publik CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX, dan High Performance Computing (HPC) yang luar biasa.
★ 512+0Perubahan bintang dalam 7 hari terakhir