cuda
Dépôts open source suivis étiquetés cuda, triés par étoiles.
- #91
Plateforme de recherche de benchmark d'inférence continue open source — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 et bientôt™ TPUv6e/v7/Trainium2/3
★ 1 667+0Évolution des étoiles sur les 7 derniers jours - #92
Bibliothèque d'opérateurs TT-NN et modèle de programmation de noyau bas niveau TT-Metalium.
★ 1 666+0Évolution des étoiles sur les 7 derniers jours - #93★ 1 631+0Évolution des étoiles sur les 7 derniers jours
- #94
ThunderSVM : Une bibliothèque SVM rapide sur GPU et CPU
★ 1 622+0Évolution des étoiles sur les 7 derniers jours - #95★ 1 616+0Évolution des étoiles sur les 7 derniers jours
- #96
Implémentation de l'effet Ken Burns 3D à partir d'une image unique utilisant PyTorch.
★ 1 570+0Évolution des étoiles sur les 7 derniers jours - #97
Auto-recherche pour les noyaux GPU. Fournissez n'importe quel modèle PyTorch, allez dormir, et réveillez-vous avec des noyaux Triton optimisés.
★ 1 556+0Évolution des étoiles sur les 7 derniers jours - #98
UCCL est une bibliothèque de communication efficace pour GPU, couvrant les collectifs, le P2P (ex: transfert de cache KV, transfert de poids RL) et l'EP (ex: piloté par GPU).
★ 1 512+0Évolution des étoiles sur les 7 derniers jours - #99★ 1 500+0Évolution des étoiles sur les 7 derniers jours
- #100
TensorRT pour YOLOv8, YOLOv8-Pose, YOLOv8-Seg, YOLOv8-Cls, YOLOv7, YOLOv6, YOLOv5, YOLONAS. CUDA est tout ce dont vous avez besoin.
★ 1 461+0Évolution des étoiles sur les 7 derniers jours - #101
Une bibliothèque de calcul numérique GPU efficace en C++20 avec une syntaxe proche de Python
★ 1 444+0Évolution des étoiles sur les 7 derniers jours - #102
Auto-hébergez le puissant modèle TTS Chatterbox. Ce serveur propose une interface Web conviviale, des points de terminaison API flexibles (compatibles OpenAI), des voix prédéfinies, le clonage vocal et le traitement de texte à grande échelle pour les livres audio. Fonctionne en mode accéléré sur NVIDIA (CUDA), AMD (ROCm) et CPU.
★ 1 440+0Évolution des étoiles sur les 7 derniers jours - #103★ 1 426+0Évolution des étoiles sur les 7 derniers jours
- #104
Une bibliothèque de tenseurs rapide, ergonomique et portable en Nim, axée sur le deep learning pour CPU, GPU et appareils embarqués via les backends OpenMP, Cuda et OpenCL
★ 1 406+0Évolution des étoiles sur les 7 derniers jours - #105
Bibliothèque rapide de chevauchement de communication pour le parallélisme de tenseurs/experts sur GPU.
★ 1 360+0Évolution des étoiles sur les 7 derniers jours - #106★ 1 326+0Évolution des étoiles sur les 7 derniers jours
- #107
https://wavespeed.ai/ Meilleur framework d'optimisation des performances d'inférence pour HuggingFace Diffusers sur les GPU NVIDIA.
★ 1 304+0Évolution des étoiles sur les 7 derniers jours - #108★ 1 270+0Évolution des étoiles sur les 7 derniers jours
- #109
GraphVite : un système de plongement de graphes général et haute performance
★ 1 269+0Évolution des étoiles sur les 7 derniers jours - #110★ 1 217+0Évolution des étoiles sur les 7 derniers jours
- #111
Script de compilation FFmpeg permettant de générer facilement une version statique de FFmpeg sur OSX et Linux, incluant les codecs non libres.
★ 1 215+0Évolution des étoiles sur les 7 derniers jours - #112
Exemples pour les boîtes à outils Intel® oneAPI.
★ 1 160+0Évolution des étoiles sur les 7 derniers jours - #113
SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.
★ 1 159+56Évolution des étoiles sur les 7 derniers jours - #114★ 1 150+0Évolution des étoiles sur les 7 derniers jours
- #115★ 1 132+0Évolution des étoiles sur les 7 derniers jours
- #116
Bibliothèque de matrices rapide pour Clojure.
★ 1 128+0Évolution des étoiles sur les 7 derniers jours - #117
Construisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version allégée de vLLM
★ 1 104+10Évolution des étoiles sur les 7 derniers jours - #118★ 1 097+0Évolution des étoiles sur les 7 derniers jours
- #119★ 1 063+1Évolution des étoiles sur les 7 derniers jours
- #120
Framework de rendu haute performance sur architectures de flux.
★ 1 044+1Évolution des étoiles sur les 7 derniers jours