Cuda
Repositorios de código abierto monitorizados que tienen Cuda como lenguaje principal, ordenados por estrellas.
- #1llm.c@karpathy
Entrenamiento de LLM en C/CUDA puro y simple
★ 30.886+44Variación de estrellas de los últimos 7 días - #2instant-ngp@NVlabs
Primitivas gráficas neuronales instantáneas: NeRF ultrarrápido y más
★ 17.536+13Variación de estrellas de los últimos 7 días - #3LeetCUDA@xlite-dev
Notas de aprendizaje de CUDA moderno con PyTorch para principiantes, más de 200 CUDA Kernels, Tensor Cores, HGEMM, FA-2 MMA.
★ 11.838+42Variación de estrellas de los últimos 7 días - #4HVM2@HigherOrderCO
Un tiempo de ejecución funcional óptimo y masivamente paralelo en Rust
★ 11.340+1Variación de estrellas de los últimos 7 días - #5DeepEP@deepseek-ai
DeepEP: una biblioteca de comunicación paralela de expertos eficiente
★ 10.070+27Variación de estrellas de los últimos 7 días - #6DeepGEMM@deepseek-ai
DeepGEMM: librería de kernels BLAS limpia y eficiente en GPU
★ 7743+29Variación de estrellas de los últimos 7 días - #7deep-high-resolution-net.pytorch@leoxiaobin
El proyecto es una implementación oficial de nuestro artículo de CVPR2019 "Deep High-Resolution Representation Learning for Human Pose Estimation"
★ 4480+1Variación de estrellas de los últimos 7 días - #8warp-ctc@baidu-research
CTC paralelo rápido.
★ 4069+0Variación de estrellas de los últimos 7 días - #9cuda-course@Infatoshi★ 3980+19Variación de estrellas de los últimos 7 días
- #10SageAttention@thu-ml
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention logra una aceleración de 2 a 5 veces en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
★ 3683+23Variación de estrellas de los últimos 7 días - #11ThunderKittens@HazyResearch
Primitivas de mosaico para núcleos rápidos
★ 3658+18Variación de estrellas de los últimos 7 días - #12
Cómo optimizar algunos algoritmos en CUDA.
★ 3224+17Variación de estrellas de los últimos 7 días - #13AlexNet-Source-Code@computerhistory
Este paquete contiene el código original de AlexNet de 2012.
★ 2971+6Variación de estrellas de los últimos 7 días - #14CUDA_Freshman@Tony-Tan★ 2794+3Variación de estrellas de los últimos 7 días
- #15CUDALibrarySamples@NVIDIA
Ejemplos de bibliotecas CUDA
★ 2489+6Variación de estrellas de los últimos 7 días - #16mirage@mirage-project
Mirage Persistent Kernel: Compilación de LLMs en un MegaKernel
★ 2458+22Variación de estrellas de los últimos 7 días - #17cugraph@rapidsai
cuGraph - Biblioteca de análisis de grafos RAPIDS
★ 2227+7Variación de estrellas de los últimos 7 días - #18CUDA-Programming@brucefan1983
Código de ejemplo para mi libro de programación en CUDA
★ 2091+1Variación de estrellas de los últimos 7 días - #19tsne-cuda@CannyLab
t-SNE acelerado por GPU para CUDA con bindings para Python
★ 1957+2Variación de estrellas de los últimos 7 días - #20nccl-tests@NVIDIA
Pruebas de NCCL
★ 1639+11Variación de estrellas de los últimos 7 días - #21diff-gaussian-rasterization@graphdeco-inria★ 1489+2Variación de estrellas de los últimos 7 días
- #22torchsparse@mit-han-lab
[MICRO'23, MLSys'22] TorchSparse: Framework eficiente de entrenamiento e inferencia para convolución dispersa en GPUs.
★ 1472+0Variación de estrellas de los últimos 7 días - #23k2@k2-fsa
Algoritmos FSA/FST, diferenciables y compatibles con PyTorch.
★ 1352+1Variación de estrellas de los últimos 7 días - #24rtp-llm@alibaba
RTP-LLM: motor de inferencia de LLM de alto rendimiento de Alibaba para diversas aplicaciones.
★ 1318+6Variación de estrellas de los últimos 7 días - #25SGEMM_CUDA@siboehm
Multiplicación de matrices rápida en CUDA desde cero
★ 1294+8Variación de estrellas de los últimos 7 días - #26FlashKDA@MoonshotAI
FlashKDA: núcleos de atención Kimi Delta de alto rendimiento
★ 1231+8Variación de estrellas de los últimos 7 días - #27flash-attention-minimal@tspeterkim
Flash Attention en ~100 líneas de CUDA (solo forward pass)
★ 1179+1Variación de estrellas de los últimos 7 días - #28CUDA_Kernel_Samples@Tongkaio
Guía de implementación manual y entrevistas sobre operadores CUDA.
★ 1097+7Variación de estrellas de los últimos 7 días - #29cuda-training-series@olcf
Materiales de formación asociados a la serie de entrenamiento CUDA de NVIDIA (www.olcf.ornl.gov/cuda-training-series/)
★ 1043+6Variación de estrellas de los últimos 7 días - #30SpargeAttn@thu-ml
[ICML2025] SpargeAttention: una atención dispersa sin entrenamiento que acelera la inferencia de cualquier modelo.
★ 1037+7Variación de estrellas de los últimos 7 días