NVIDIA/TensorRT-LLM
@NVIDIATensorRT LLM fournit aux utilisateurs une API Python facile à utiliser pour définir des modèles de langage étendus (LLM) et prend en charge des optimisations de pointe pour effectuer des inférences efficacement sur les GPU NVIDIA. TensorRT LLM contient également des composants pour créer des runtimes Python et C++ qui orchestrent l'exécution de l'inférence de manière performante.
Étoiles
14 498
Bifurcations
2 701
Langage
Python
Licence
NOASSERTION
Dernier push
il y a 2 jours
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.