scrya-com/rotorquant
@scrya-comCompression de cache KV via rotation bloc-diagonale. Surpasse TurboQuant : meilleur PPL (6,91 contre 7,07), décodage 28 % plus rapide, pré-remplissage 5,3x plus rapide, 44x moins de paramètres. Intégration directe dans llama.cpp.
Étoiles
1 045
Bifurcations
89
Langage
Python
Licence
—
Dernier push
il y a 5 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.