cuda
Các kho mã nguồn mở đang theo dõi được gắn thẻ cuda, sắp xếp theo số sao.
- #181
Các phương pháp hay nhất và hướng dẫn viết mã huấn luyện PyTorch phân tán
★ 631+2Thay đổi số sao trong 7 ngày qua - #182★ 622+2Thay đổi số sao trong 7 ngày qua
- #183
Trình kết xuất Monte Carlo đa nền tảng hiệu suất cao dựa trên LuisaCompute.
★ 618+1Thay đổi số sao trong 7 ngày qua - #184★ 616+0Thay đổi số sao trong 7 ngày qua
- #185
AutoDock cho GPU và các bộ tăng tốc khác
★ 610+1Thay đổi số sao trong 7 ngày qua - #186
Một tập con của các mô-đun mạng thần kinh trong PyTorch, được viết bằng Python sử dụng Triton của OpenAI.
★ 604+0Thay đổi số sao trong 7 ngày qua - #187
Ứng dụng và hướng dẫn để cấu hình dễ dàng Windows, Linux, MacOS, Google TV, Stremio, Home Assistant và nhiều nền tảng khác (bao gồm WSL2, trình điều khiển GPU & công cụ phát triển). Cải thiện trải nghiệm người dùng và năng suất của bạn.
★ 602+0Thay đổi số sao trong 7 ngày qua - #188
Go với trí tuệ của riêng bạn - Các ứng dụng Go tích hợp trực tiếp llama.cpp để suy luận cục bộ sử dụng tăng tốc phần cứng.
★ 599+17Thay đổi số sao trong 7 ngày qua - #189
Yet Another Language Model: Suy luận LLM bằng C++/CUDA, không sử dụng thư viện ngoại trừ I/O.
★ 597+1Thay đổi số sao trong 7 ngày qua - #190★ 594+1Thay đổi số sao trong 7 ngày qua
- #191★ 592+0Thay đổi số sao trong 7 ngày qua
- #192
NVIDIA NVSHMEM là giao diện lập trình song song cho GPU NVIDIA dựa trên OpenSHMEM. NVSHMEM có thể giảm đáng kể chi phí liên lạc và điều phối đa tiến trình bằng cách cho phép lập trình viên thực hiện giao tiếp một chiều từ bên trong các nhân CUDA và trên các luồng CUDA.
★ 585+4Thay đổi số sao trong 7 ngày qua - #193
Trình mô phỏng Radar được xây dựng bằng Python và C++
★ 576+3Thay đổi số sao trong 7 ngày qua - #194
Dự án thực hành cho sinh viên, hướng dẫn tự xây dựng khung suy luận mô hình lớn hỗ trợ LLama2/3 và Qwen2.5 từ con số không.
★ 574+0Thay đổi số sao trong 7 ngày qua - #195
Thư viện C++ single-header giúp đơn giản hóa việc sử dụng CUDA Runtime Compilation (NVRTC).
★ 574+0Thay đổi số sao trong 7 ngày qua - #196
Bộ sưu tập mở các phương pháp luận hỗ trợ huấn luyện thành công các mô hình ngôn ngữ lớn.
★ 569+2Thay đổi số sao trong 7 ngày qua - #197
Một số phương pháp tối ưu hóa phép nhân ma trận bán chính xác (HGEMM) sử dụng tensor core với WMMA API và lệnh MMA PTX
★ 568+0Thay đổi số sao trong 7 ngày qua - #198
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 566+0Thay đổi số sao trong 7 ngày qua - #199
FlashRT là công cụ suy luận thời gian thực hiệu năng cao cho các tác vụ AI có độ trễ thấp và batch nhỏ. Tích hợp chủ đạo bao gồm điều khiển VLA sản xuất cho Pi0, Pi0.5, GROOT N1.6 và Pi0-FAST. Ngoài ra còn hỗ trợ LLM như qwen3.6-27B
★ 562+14Thay đổi số sao trong 7 ngày qua - #200★ 560+1Thay đổi số sao trong 7 ngày qua
- #201
Phòng thực hành thuật toán LLM với lý thuyết, lời giải và các trường hợp kiểm thử. Hướng dẫn thực hành thuật toán từ cơ bản đến nâng cao cho các mô hình lớn, bao gồm giải thích nguyên lý, phân tích đáp án, trường hợp kiểm thử và thực hành CUDA/Triton.
★ 559+20Thay đổi số sao trong 7 ngày qua - #202
Sử dụng VRAM của GPU NVIDIA làm không gian swap trên Linux. Được xây dựng cho các máy tính xách tay có bộ nhớ hàn chết và không thể nâng cấp. Nếu bạn có card RTX với 8GB VRAM đang nhàn rỗi và hệ thống đang phải swap sang SSD, công cụ này sẽ tận dụng lượng VRAM đó.
★ 555+4Thay đổi số sao trong 7 ngày qua - #203★ 552+2Thay đổi số sao trong 7 ngày qua
- #204
Cụm Slurm sử dụng docker-compose
★ 544+2Thay đổi số sao trong 7 ngày qua - #205★ 532+0Thay đổi số sao trong 7 ngày qua
- #206
Triển khai lại Holistically-Nested Edge Detection trong PyTorch
★ 525+0Thay đổi số sao trong 7 ngày qua - #207
Trực quan hóa dữ liệu và dò tia (ray tracing) trong Python dựa trên framework OptiX 9.1.
★ 518+0Thay đổi số sao trong 7 ngày qua - #208★ 518-1Thay đổi số sao trong 7 ngày qua
- #209
Docker Image cho Ubuntu Desktop hỗ trợ ứng dụng GUI tăng tốc phần cứng GPU. Bạn có thể truy cập Container bằng ssh hoặc remote desktop, giống như Cloud VM.
★ 515+0Thay đổi số sao trong 7 ngày qua - #210
Danh sách các dự án mã nguồn mở nổi bật về CUDA, cuda-python, cuBLAS, cuDNN, CUTLASS, TensorRT, TensorRT-LLM, Triton, TVM, MLIR, PTX và Điện toán hiệu năng cao (HPC).
★ 512+0Thay đổi số sao trong 7 ngày qua