scrya-com/rotorquant
@scrya-comCompresión de caché KV mediante rotación diagonal por bloques. Supera a TurboQuant: mejor PPL (6.91 frente a 7.07), decodificación un 28% más rápida, prellenado 5.3 veces más rápido y 44 veces menos parámetros. Integración directa en llama.cpp.
Estrellas
1046
Bifurcaciones
90
Lenguaje
Python
Licencia
—
Último push
hace 5 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.