Saltar al contenido principal
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant: cuantización de caché KV casi óptima para inferencia de LLM (claves de 3 bits, valores de 2 bits) con kernels de Triton e integración con vLLM

Estrellas
1753
Bifurcaciones
195
Lenguaje
Python
Licencia
GPL-3.0
Último push
hace 5 meses
Python

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.