cuda
Dépôts open source suivis étiquetés cuda, triés par étoiles.
- #181
Meilleures pratiques et guides pour écrire du code de formation distribuée PyTorch
★ 631+2Évolution des étoiles sur les 7 derniers jours - #182★ 622+2Évolution des étoiles sur les 7 derniers jours
- #183
Moteur de rendu Monte Carlo multiplateforme haute performance basé sur LuisaCompute.
★ 618+1Évolution des étoiles sur les 7 derniers jours - #184
Optimisation de l'entraînement et de l'inférence d'AlphaFold sur des clusters de GPU
★ 616+0Évolution des étoiles sur les 7 derniers jours - #185
AutoDock pour les GPU et autres accélérateurs
★ 610+1Évolution des étoiles sur les 7 derniers jours - #186
Un sous-ensemble des modules de réseaux de neurones de PyTorch, écrits en Python avec le Triton d'OpenAI.
★ 604+0Évolution des étoiles sur les 7 derniers jours - #187
Une application et un guide pour configurer facilement Windows, Linux, MacOS, Google TV, Stremio, Home Assistant et plus encore (notamment WSL2, les pilotes GPU et les outils de développement). Améliorez votre expérience utilisateur et votre productivité.
★ 602+0Évolution des étoiles sur les 7 derniers jours - #188
Go avec votre propre intelligence - Applications Go qui intègrent directement llama.cpp pour l'inférence locale avec accélération matérielle.
★ 599+17Évolution des étoiles sur les 7 derniers jours - #189
Yet Another Language Model : inférence LLM en C++/CUDA, sans aucune bibliothèque à l'exception des E/S.
★ 597+1Évolution des étoiles sur les 7 derniers jours - #190★ 594+1Évolution des étoiles sur les 7 derniers jours
- #191★ 592+0Évolution des étoiles sur les 7 derniers jours
- #192
NVIDIA NVSHMEM est une interface de programmation parallèle pour les GPU NVIDIA basée sur OpenSHMEM. NVSHMEM peut réduire considérablement la communication multi-processus et les frais généraux de coordination en permettant aux programmeurs d'effectuer une communication unilatérale à partir des noyaux CUDA et sur les flux CUDA.
★ 585+4Évolution des étoiles sur les 7 derniers jours - #193
Simulateur radar construit avec Python et C++
★ 576+3Évolution des étoiles sur les 7 derniers jours - #194
Une bibliothèque C++ en en-tête unique pour simplifier l'utilisation de la compilation runtime CUDA (NVRTC).
★ 574+0Évolution des étoiles sur les 7 derniers jours - #195
Un excellent projet pour le recrutement universitaire, d'automne, de printemps et les stages, vous guidant pour implémenter à partir de zéro un framework d'inférence de grands modèles prenant en charge LLama2/3 et Qwen2.5.
★ 574+0Évolution des étoiles sur les 7 derniers jours - #196
Une collection ouverte de méthodologies pour faciliter l'entraînement réussi de grands modèles de langage.
★ 569+2Évolution des étoiles sur les 7 derniers jours - #197
Plusieurs méthodes d'optimisation de la multiplication de matrices générales en demi-précision (HGEMM) utilisant les tensor cores avec l'API WMMA et l'instruction PTX MMA.
★ 568+0Évolution des étoiles sur les 7 derniers jours - #198
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+0Évolution des étoiles sur les 7 derniers jours - #199
FlashRT est un moteur d'inférence haute performance en temps réel pour les charges de travail IA à faible lot et sensibles à la latence. L'intégration phare concerne le contrôle VLA en production pour Pi0, Pi0.5, GROOT N1.6 et Pi0-FAST. Il prend également en charge les LLM tels que qwen3.6-27B.
★ 562+14Évolution des étoiles sur les 7 derniers jours - #200
Moteur de mini-inférence statique, suckless, mono-lot (single batch) et exclusivement CUDA pour qwen3-0.6B
★ 560+1Évolution des étoiles sur les 7 derniers jours - #201
LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程,覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。
★ 559+20Évolution des étoiles sur les 7 derniers jours - #202
Utilisez la VRAM de votre GPU NVIDIA comme espace d'échange (swap) sous Linux. Conçu pour les ordinateurs portables avec mémoire soudée sans possibilité de mise à niveau. Si vous avez une carte RTX avec 8 Go de VRAM et que vous utilisez le swap sur SSD, cela permet d'exploiter cette VRAM.
★ 555+4Évolution des étoiles sur les 7 derniers jours - #203★ 552+2Évolution des étoiles sur les 7 derniers jours
- #204
Un cluster Slurm utilisant docker-compose
★ 544+2Évolution des étoiles sur les 7 derniers jours - #205★ 532+0Évolution des étoiles sur les 7 derniers jours
- #206
Une réimplémentation de Holistically-Nested Edge Detection en PyTorch
★ 525+0Évolution des étoiles sur les 7 derniers jours - #207
Visualisation de données et ray tracing en Python basés sur le framework OptiX 9.1.
★ 518+0Évolution des étoiles sur les 7 derniers jours - #208★ 518-1Évolution des étoiles sur les 7 derniers jours
- #209
Image Docker pour Ubuntu Desktop prenant en charge les applications GUI avec accélération matérielle GPU. Accédez au conteneur via ssh ou bureau à distance, comme une VM Cloud.
★ 515+0Évolution des étoiles sur les 7 derniers jours - #210
Serveur d'inférence linguistique open-source, local et auto-hébergé, hautement optimisé, prenant en charge ASR/STT, TTS et LLM via WebRTC, REST et WS.
★ 512+0Évolution des étoiles sur les 7 derniers jours