weicj/vLLM-2080Ti-Definitive
@weicjDie definitive vLLM-Laufzeitumgebung für zwei RTX 2080 Ti (22 GB) + NVLink, die lokale Qwen-27B-Inferenz mit maximal über 100 Token/s Single-Request-Dekodierung und Unterstützung für FP8-Gewichte liefert
Sterne
828
Forks
124
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 1 Tag
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.