Zum Hauptinhalt springen
buildradar
Sign in

weicj/vLLM-2080Ti-Definitive

@weicj

Die definitive vLLM-Laufzeitumgebung für zwei RTX 2080 Ti (22 GB) + NVLink, die lokale Qwen-27B-Inferenz mit maximal über 100 Token/s Single-Request-Dekodierung und Unterstützung für FP8-Gewichte liefert

Sterne
828
Forks
124
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 1 Tag
Python

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.