Aller au contenu principal
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant : quantification de cache KV quasi optimale pour l'inférence LLM (clés 3 bits, valeurs 2 bits) avec noyaux Triton et intégration vLLM

Étoiles
1 753
Bifurcations
195
Langage
Python
Licence
GPL-3.0
Dernier push
il y a 5 mois
Python

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.