0xSero/turboquant
@0xSeroTurboQuant : quantification de cache KV quasi optimale pour l'inférence LLM (clés 3 bits, valeurs 2 bits) avec noyaux Triton et intégration vLLM
Étoiles
1 753
Bifurcations
195
Langage
Python
Licence
GPL-3.0
Dernier push
il y a 5 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.