cuda
标记 cuda 主题、收录中的开源项目,按星标数排序。
- #91★ 1,655+0近 7 天星标变化
- #92★ 1,625+0近 7 天星标变化
- #93
ThunderSVM:基于 GPU 与 CPU 的快速 SVM 库
★ 1,622+0近 7 天星标变化 - #94★ 1,617+0近 7 天星标变化
- #95
开源持续推理基准研究平台 — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & 即将推出™ TPUv6e/v7/Trainium2/3
★ 1,613+0近 7 天星标变化 - #96
从单一影像实现 3D Ken Burns 效果的 PyTorch 实现
★ 1,569+0近 7 天星标变化 - #97
GPU 内核自动研究。给它任何 PyTorch 模型,睡个觉,醒来就能获得优化的 Triton 内核。
★ 1,545+0近 7 天星标变化 - #98★ 1,502+0近 7 天星标变化
- #99★ 1,492+0近 7 天星标变化
- #100
🔥🔥🔥 适用于 YOLOv8、YOLOv8-Pose、YOLOv8-Seg、YOLOv8-Cls、YOLOv7、YOLOv6、YOLOv5、YOLONAS......的 TensorRT 🚀🚀🚀 CUDA IS ALL YOU NEED. 🍎🍎🍎
★ 1,460+0近 7 天星标变化 - #101★ 1,444+0近 7 天星标变化
- #102
自架强大的 Chatterbox TTS 模型。此服务器提供用户友好的 Web UI、灵活的 API 端点(包含兼容 OpenAI)、预定义语音、语音克隆,以及大型有声书规模的文本处理。可在 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 上加速运行。
★ 1,427+0近 7 天星标变化 - #103★ 1,426+0近 7 天星标变化
- #104
一个在 Nim 中快速、符合人体工程学且可移植的张量库,通过 OpenMP、Cuda 和 OpenCL 后端专注于 CPU、GPU 和嵌入式设备的深度学习
★ 1,407+0近 7 天星标变化 - #105★ 1,358+0近 7 天星标变化
- #106★ 1,323+0近 7 天星标变化
- #107
https://wavespeed.ai/ 用于 NVIDIA GPU 上 HuggingFace Diffusers 的最佳推理性能优化框架。
★ 1,304+0近 7 天星标变化 - #108★ 1,270+0近 7 天星标变化
- #109★ 1,269+0近 7 天星标变化
- #110
FFmpeg 构建脚本提供了一个简单的方法,在 OSX 和 Linux 上构建包含非自由编解码器的静态 FFmpeg。
★ 1,215+0近 7 天星标变化 - #111★ 1,214+0近 7 天星标变化
- #112
Intel® oneAPI Toolkits 的示例代码
★ 1,162+0近 7 天星标变化 - #113★ 1,150+0近 7 天星标变化
- #114★ 1,131+0近 7 天星标变化
- #115
快速的 Clojure 矩阵库
★ 1,128+0近 7 天星标变化 - #116
SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。
★ 1,118+56近 7 天星标变化 - #117★ 1,100+10近 7 天星标变化
- #118★ 1,096+0近 7 天星标变化
- #119★ 1,064+1近 7 天星标变化
- #120
流式架构上的高性能渲染框架
★ 1,044+1近 7 天星标变化