0xSero/turboquant
@0xSeroTurboQuant: cuantización de caché KV casi óptima para inferencia de LLM (claves de 3 bits, valores de 2 bits) con kernels de Triton e integración con vLLM
Estrellas
1753
Bifurcaciones
195
Lenguaje
Python
Licencia
GPL-3.0
Último push
hace 5 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.