Zum Hauptinhalt springen
buildradar
Sign in

scrya-com/rotorquant

@scrya-com

KV-Cache-Kompression über blockdiagonale Rotation. Schlägt TurboQuant: bessere PPL (6,91 vs. 7,07), 28 % schnelleres Dekodieren, 5,3x schnelleres Prefill, 44x weniger Parameter. Nahtlose llama.cpp-Integration.

Sterne
1.045
Forks
89
Sprache
Python
Lizenz
Letzter Push
vor 4 Monaten
Python

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.