tonbistudio/turboquant-pytorch
@tonbistudioImplémentation PyTorch complète de TurboQuant de Google (ICLR 2026) pour la compression du cache KV des LLM. Compression 5x en 3 bits avec 99,5 % de fidélité d'attention.
Étoiles
1 044
Bifurcations
140
Langage
Python
Licence
MIT
Dernier push
il y a 5 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.