cuda
標記 cuda 主題、收錄中的開源專案,依星數排序。
- #181
關於如何編寫分佈式 PyTorch 訓練程式碼的最佳實踐與指南
★ 631+2近 7 天星數變化 - #182★ 622+2近 7 天星數變化
- #183
基於 LuisaCompute 的高效能跨平臺蒙地卡羅渲染器
★ 618+1近 7 天星數變化 - #184★ 616+0近 7 天星數變化
- #185
適用於 GPU 與其他加速器的 AutoDock
★ 610+1近 7 天星數變化 - #186★ 604+0近 7 天星數變化
- #187
一個用於輕鬆設定 Windows、Linux、MacOS、Google TV、Stremio、Home Assistant 等系統的應用程式與指南(包含 WSL2、GPU 驅動程式與開發工具)。提升您的使用者體驗與生產力。
★ 602+0近 7 天星數變化 - #188★ 599+17近 7 天星數變化
- #189★ 597+1近 7 天星數變化
- #190★ 594+1近 7 天星數變化
- #191★ 592+0近 7 天星數變化
- #192
NVIDIA NVSHMEM 是一個基於 OpenSHMEM 的 NVIDIA GPU 平行程式設計介面。NVSHMEM 允許程式設計師在 CUDA kernel 和 CUDA stream 中執行單向通訊,從而顯著降低多處理程序通訊與協調的開銷。
★ 585+4近 7 天星數變化 - #193
使用 Python 與 C++ 建構的雷達模擬器
★ 576+3近 7 天星數變化 - #194★ 574+0近 7 天星數變化
- #195
校招、秋招、春招與實習專案,帶您從零實作支援 LLama2/3 與 Qwen2.5 的大模型推理框架。
★ 574+0近 7 天星數變化 - #196
協助成功訓練大型語言模型的開放方法論集合
★ 569+2近 7 天星數變化 - #197
使用 WMMA API 與 MMA PTX 指令,透過 Tensor Core 進行半精度通用矩陣乘法 (HGEMM) 的多種最佳化方法。
★ 568+0近 7 天星數變化 - #198
從教師模型到模型切片——從零開始的 LLM 蒸餾與服務引擎:包含自訂 Triton/CUDA 核心、FSDP 蒸餾、paged-KV 連續批次處理、推測解碼、Rust 閘道、JAX 預測器與可解釋性工具。
★ 566+0近 7 天星數變化 - #199
FlashRT 是一款高效能即時推論引擎,專為小批次、低延遲 AI 工作負載設計。旗艦整合包含 Pi0、Pi0.5、GROOT N1.6 及 Pi0-FAST 的生產級 VLA 控制,並支援如 qwen3.6-27B 等大型語言模型。
★ 562+14近 7 天星數變化 - #200★ 560+1近 7 天星數變化
- #201
LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程,覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。
★ 559+20近 7 天星數變化 - #202
在 Linux 上將 NVIDIA GPU 的 VRAM 作為交換空間使用。專為記憶體焊死且無法升級的筆電設計。若你有 8GB VRAM 的 RTX 顯卡且系統正頻繁使用 SSD 交換,此工具可有效利用該 VRAM。
★ 555+4近 7 天星數變化 - #203★ 552+2近 7 天星數變化
- #204
使用 docker-compose 建立的 Slurm 叢集
★ 544+2近 7 天星數變化 - #205★ 532+0近 7 天星數變化
- #206
Holistically-Nested Edge Detection 的 PyTorch 重新實作。
★ 525+0近 7 天星數變化 - #207★ 518+0近 7 天星數變化
- #208★ 518-1近 7 天星數變化
- #209
支援硬體 GPU 加速 GUI 應用程式的 Ubuntu Desktop Docker 映像檔。您可以像使用雲端 VM 一樣,透過 SSH 或遠端桌面存取容器。
★ 515+0近 7 天星數變化 - #210
使用 PyTorch 實作可微分前向扭曲 (differentiable forward warping) 的 softmax splatting
★ 512+0近 7 天星數變化