Zum Hauptinhalt springen
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant: Nahezu optimale KV-Cache-Quantisierung für LLM-Inferenz (3-Bit-Schlüssel, 2-Bit-Werte) mit Triton-Kerneln + vLLM-Integration

Sterne
1.753
Forks
195
Sprache
Python
Lizenz
GPL-3.0
Letzter Push
vor 5 Monaten
Python

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.