Aller au contenu principal
buildradar
Sign in

scrya-com/rotorquant

@scrya-com

Compression de cache KV via rotation bloc-diagonale. Surpasse TurboQuant : meilleur PPL (6,91 contre 7,07), décodage 28 % plus rapide, pré-remplissage 5,3x plus rapide, 44x moins de paramètres. Intégration directe dans llama.cpp.

Étoiles
1 045
Bifurcations
89
Langage
Python
Licence
Dernier push
il y a 5 mois
Python

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.