cuda
标记 cuda 主题、收录中的开源项目,按星标数排序。
- #181
关于如何编写分布式 PyTorch 训练代码的最佳实践与指南
★ 631+2近 7 天星标变化 - #182★ 622+2近 7 天星标变化
- #183
基于 LuisaCompute 的高性能跨平台蒙特卡洛渲染器
★ 618+1近 7 天星标变化 - #184★ 616+0近 7 天星标变化
- #185
适用于 GPU 和其他加速器的 AutoDock
★ 610+1近 7 天星标变化 - #186★ 604+0近 7 天星标变化
- #187
一个用于轻松配置 Windows、Linux、MacOS、Google TV、Stremio、Home Assistant 等系统的应用程序与指南(包含 WSL2、GPU 驱动程序与开发工具)。提升您的用户体验与生产力。
★ 602+0近 7 天星标变化 - #188★ 599+17近 7 天星标变化
- #189★ 597+1近 7 天星标变化
- #190★ 594+1近 7 天星标变化
- #191★ 592+0近 7 天星标变化
- #192
NVIDIA NVSHMEM 是一个基于 OpenSHMEM 的 NVIDIA GPU 并行编程接口。NVSHMEM 允许程序员在 CUDA kernel 和 CUDA stream 中执行单向通信,从而显著降低多进程通信与协调的开销。
★ 585+4近 7 天星标变化 - #193
使用 Python 与 C++ 构建的雷达模拟器
★ 576+3近 7 天星标变化 - #194
校招、秋招、春招与实习项目,带您从零实现支持 LLama2/3 与 Qwen2.5 的大模型推理框架。
★ 574+0近 7 天星标变化 - #195★ 574+0近 7 天星标变化
- #196
协助成功训练大型语言模型的开放方法论集合
★ 569+2近 7 天星标变化 - #197
使用 WMMA API 与 MMA PTX 指令,通过 Tensor Core 进行半精度通用矩阵乘法 (HGEMM) 的多种优化方法。
★ 568+0近 7 天星标变化 - #198
从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。
★ 566+0近 7 天星标变化 - #199
FlashRT 是一款高性能实时推理引擎,专为小批次、低延迟 AI 工作负载设计。旗舰集成包含 Pi0、Pi0.5、GROOT N1.6 及 Pi0-FAST 的生产级 VLA 控制,并支持如 qwen3.6-27B 等大型语言模型。
★ 562+14近 7 天星标变化 - #200★ 560+1近 7 天星标变化
- #201
LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程,覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。
★ 559+20近 7 天星标变化 - #202
在 Linux 上将 NVIDIA GPU 的 VRAM 作为交换空间使用。专为内存焊死且无法升级的笔记本设计。若你有 8GB VRAM 的 RTX 显卡且系统正频繁使用 SSD 交换,此工具可有效利用该 VRAM。
★ 555+4近 7 天星标变化 - #203★ 552+2近 7 天星标变化
- #204
使用 docker-compose 建立的 Slurm 集群
★ 544+2近 7 天星标变化 - #205★ 532+0近 7 天星标变化
- #206
Holistically-Nested Edge Detection 的 PyTorch 重新实现。
★ 525+0近 7 天星标变化 - #207★ 518+0近 7 天星标变化
- #208★ 518-1近 7 天星标变化
- #209
支持硬件 GPU 加速 GUI 应用程序的 Ubuntu Desktop Docker 镜像。您可以像使用云端 VM 一样,通过 SSH 或远程桌面访问容器。
★ 515+0近 7 天星标变化 - #210
此仓库列出了一些优秀的 CUDA、cuda-python、cuBLAS、cuDNN、CUTLASS、TensorRT、TensorRT-LLM、Triton、TVM、MLIR、PTX 与高性能计算 (HPC) 项目。
★ 512+0近 7 天星标变化