跳到主要内容
buildradar
登录
主题 · cuda

cuda

标记 cuda 主题、收录中的开源项目,按星标数排序。

共 216 个项目
  • 关于如何编写分布式 PyTorch 训练代码的最佳实践与指南

    631+2近 7 天星标变化
  • ginkgo@ginkgo-project

    数值线性代数软件套件

    622+2近 7 天星标变化
  • LuisaRender@LuisaGroup

    基于 LuisaCompute 的高性能跨平台蒙特卡洛渲染器

    618+1近 7 天星标变化
  • FastFold@hpcaitech

    在 GPU 集群上优化 AlphaFold 的训练与推理

    616+0近 7 天星标变化
  • AutoDock-GPU@ccsb-scripps

    适用于 GPU 和其他加速器的 AutoDock

    610+1近 7 天星标变化
  • attorch@BobMcDear

    PyTorch 神经网路模组的子集,使用 OpenAI 的 Triton 以 Python 编写。

    604+0近 7 天星标变化
  • personal-os-setup@AmineDjeghri

    一个用于轻松配置 Windows、Linux、MacOS、Google TV、Stremio、Home Assistant 等系统的应用程序与指南(包含 WSL2、GPU 驱动程序与开发工具)。提升您的用户体验与生产力。

    602+0近 7 天星标变化
  • yzma@hybridgroup

    赋予应用程序智慧:直接整合 llama.cpp 以利用硬件加速进行本地推理的 Go 应用程序

    599+17近 7 天星标变化
  • yalm@andrewkchan

    又一个语言模型:使用 C++/CUDA 实现的 LLM 推理,除 I/O 外不依赖任何库

    597+1近 7 天星标变化
  • pymde@cvxgrp

    基于 PyTorch 的最小失真嵌入。

    594+1近 7 天星标变化
  • dace@spcl

    DaCe - 以数据为中心的并行程序设计

    592+0近 7 天星标变化
  • nvshmem@NVIDIA

    NVIDIA NVSHMEM 是一个基于 OpenSHMEM 的 NVIDIA GPU 并行编程接口。NVSHMEM 允许程序员在 CUDA kernel 和 CUDA stream 中执行单向通信,从而显著降低多进程通信与协调的开销。

    585+4近 7 天星标变化
  • radarsimpy@radarsimx

    使用 Python 与 C++ 构建的雷达模拟器

    576+3近 7 天星标变化
  • KuiperLLama@zjhellofss

    校招、秋招、春招与实习项目,带您从零实现支持 LLama2/3 与 Qwen2.5 的大模型推理框架。

    574+0近 7 天星标变化
  • jitify@NVIDIA

    一个单头文件 C++ 库,用于简化 CUDA Runtime Compilation (NVRTC) 的使用。

    574+0近 7 天星标变化
  • llm_training_handbook@huggingface

    协助成功训练大型语言模型的开放方法论集合

    569+2近 7 天星标变化
  • cuda_hgemm@Bruce-Lee-LY

    使用 WMMA API 与 MMA PTX 指令,通过 Tensor Core 进行半精度通用矩阵乘法 (HGEMM) 的多种优化方法。

    568+0近 7 天星标变化
  • tessera@zengxiao-he

    从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。

    566+0近 7 天星标变化
  • FlashRT@flashrt-project

    FlashRT 是一款高性能实时推理引擎,专为小批次、低延迟 AI 工作负载设计。旗舰集成包含 Pi0、Pi0.5、GROOT N1.6 及 Pi0-FAST 的生产级 VLA 控制,并支持如 qwen3.6-27B 等大型语言模型。

    562+14近 7 天星标变化
  • qwen600@yassa9

    静态 suckless 单批次仅限 CUDA 的 qwen3-0.6B 小型推理引擎。

    560+1近 7 天星标变化
  • llm-algo-leetcode@datawhalechina

    LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程,覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。

    559+20近 7 天星标变化
  • nbd-vram@c0deJedi

    在 Linux 上将 NVIDIA GPU 的 VRAM 作为交换空间使用。专为内存焊死且无法升级的笔记本设计。若你有 8GB VRAM 的 RTX 显卡且系统正频繁使用 SSD 交换,此工具可有效利用该 VRAM。

    555+4近 7 天星标变化
  • relion@3dem

    用于冷冻电子显微镜的图像处理软件

    552+2近 7 天星标变化
  • slurm-docker-cluster@giovtorres

    使用 docker-compose 建立的 Slurm 集群

    544+2近 7 天星标变化
  • cu@gorgonia

    cu 包提供 CUDA Driver API 的惯用接口

    532+0近 7 天星标变化
  • pytorch-hed@sniklaus

    Holistically-Nested Edge Detection 的 PyTorch 重新实现。

    525+0近 7 天星标变化
  • plotoptix@rnd-team-dev

    基于 OptiX 9.1 框架的 Python 数据可视化与光线追踪工具。

    518+0近 7 天星标变化
  • INSTA@Zielon

    INSTA - 即时体积头部虚拟化身 [CVPR2023]

    518-1近 7 天星标变化
  • 支持硬件 GPU 加速 GUI 应用程序的 Ubuntu Desktop Docker 镜像。您可以像使用云端 VM 一样,通过 SSH 或远程桌面访问容器。

    515+0近 7 天星标变化
  • 此仓库列出了一些优秀的 CUDA、cuda-python、cuBLAS、cuDNN、CUTLASS、TensorRT、TensorRT-LLM、Triton、TVM、MLIR、PTX 与高性能计算 (HPC) 项目。

    512+0近 7 天星标变化
← 返回主题列表