Aller au contenu principal
buildradar
Se connecter

weicj/vLLM-2080Ti-Definitive

@weicj

Le runtime vLLM définitif pour deux cartes RTX 2080 Ti 22 Go + NVLink, offrant une inférence locale pour Qwen 27B avec un décodage à requête unique atteignant plus de 100 tok/s et un support des poids FP8.

Étoiles
828
Bifurcations
124
Langage
Python
Licence
Apache-2.0
Dernier push
il y a 2 jours
Python

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.