cuda-kernels
Dépôts open source suivis étiquetés cuda-kernels, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de cuda-kernels sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés cuda-kernels.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Notes d'apprentissage modernes sur CUDA avec PyTorch pour débutants, incluant plus de 200 noyaux CUDA, Tensor Cores, HGEMM, FA-2 MMA.
★ 11 875+39Évolution des étoiles sur les 7 derniers jours - #2
Exemples pour les développeurs CUDA démontrant les fonctionnalités du CUDA Toolkit.
★ 9 585+30Évolution des étoiles sur les 7 derniers jours - #3
LMDeploy est une boîte à outils pour la compression, le déploiement et la mise en service de LLM.
★ 8 041+16Évolution des étoiles sur les 7 derniers jours - #4
Écosystème de bibliothèques et d'outils pour écrire et exécuter du code GPU rapide entièrement en Rust.
★ 5 334+3Évolution des étoiles sur les 7 derniers jours - #5★ 2 829+38Évolution des étoiles sur les 7 derniers jours
- #6★ 2 500+10Évolution des étoiles sur les 7 derniers jours
- #7
Deep learning en Rust, avec des tenseurs et réseaux de neurones vérifiés par forme.
★ 1 933+1Évolution des étoiles sur les 7 derniers jours - #8★ 1 214+1Évolution des étoiles sur les 7 derniers jours
- #9
Une bibliothèque de machine learning avec une API TypeScript et un backend Rust. Compatible CUDA et WebGPU. Conçue pour comprendre le fonctionnement interne des frameworks et modèles de ML.
★ 1 005+4Évolution des étoiles sur les 7 derniers jours - #10
cuDNN Frontend est le point d'entrée moderne et open-source de NVIDIA vers la bibliothèque cuDNN et une collection croissante de noyaux open-source haute performance.
★ 929+7Évolution des étoiles sur les 7 derniers jours - #11★ 925+1Évolution des étoiles sur les 7 derniers jours
- #12
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 673+13Évolution des étoiles sur les 7 derniers jours - #13
FlashRT est un moteur d'inférence haute performance en temps réel pour les charges de travail IA à faible lot et sensibles à la latence. L'intégration phare concerne le contrôle VLA en production pour Pi0, Pi0.5, GROOT N1.6 et Pi0-FAST. Il prend également en charge les LLM tels que qwen3.6-27B.
★ 546+9Évolution des étoiles sur les 7 derniers jours