cuda-kernels
Repositorios de código abierto monitorizados etiquetados con cuda-kernels, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a cuda-kernels en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con cuda-kernels.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Notas de aprendizaje de CUDA moderno con PyTorch para principiantes, más de 200 CUDA Kernels, Tensor Cores, HGEMM, FA-2 MMA.
★ 11.875+25Variación de estrellas de los últimos 7 días - #2
Ejemplos para desarrolladores de CUDA que demuestran las características del CUDA Toolkit
★ 9585+19Variación de estrellas de los últimos 7 días - #3★ 8041+8Variación de estrellas de los últimos 7 días
- #4
Ecosistema de bibliotecas y herramientas para escribir y ejecutar código GPU rápido completamente en Rust.
★ 5334+3Variación de estrellas de los últimos 7 días - #5★ 2829+16Variación de estrellas de los últimos 7 días
- #6★ 2500+8Variación de estrellas de los últimos 7 días
- #7
Aprendizaje profundo en Rust, con tensores verificados por forma y redes neuronales
★ 1933+0Variación de estrellas de los últimos 7 días - #8★ 1214-1Variación de estrellas de los últimos 7 días
- #9
Una biblioteca de aprendizaje automático con API en TypeScript y backend en Rust. Compatible con CUDA y WebGPU. Creada para comprender cómo funcionan internamente los marcos y modelos de ML.
★ 1005+8Variación de estrellas de los últimos 7 días - #10
cuDNN Frontend es el punto de entrada moderno y de código abierto de NVIDIA a la biblioteca cuDNN y a una creciente colección de kernels de alto rendimiento.
★ 929+11Variación de estrellas de los últimos 7 días - #11★ 925+1Variación de estrellas de los últimos 7 días
- #12
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 673+14Variación de estrellas de los últimos 7 días - #13
FlashRT es un motor de inferencia en tiempo real de alto rendimiento para cargas de trabajo de IA de lotes pequeños y sensibles a la latencia. Su integración principal es el control VLA de producción para Pi0, Pi0.5, GROOT N1.6 y Pi0-FAST. También admite LLM como qwen3.6-27B.
★ 549+11Variación de estrellas de los últimos 7 días