scrya-com/rotorquant
@scrya-comCompressão de KV cache via rotação diagonal em blocos. Supera o TurboQuant: melhor PPL (6,91 vs 7,07), decodificação 28% mais rápida, prefill 5,3x mais rápido, 44x menos parâmetros. Integração direta (drop-in) com o llama.cpp.
Estrelas
1.046
Bifurcações
90
Linguagem
Python
Licença
—
Último push
há 5 meses
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.