Pular para o conteúdo principal
buildradar
Sign in

scrya-com/rotorquant

@scrya-com

Compressão de KV cache via rotação diagonal em blocos. Supera o TurboQuant: melhor PPL (6,91 vs 7,07), decodificação 28% mais rápida, prefill 5,3x mais rápido, 44x menos parâmetros. Integração direta (drop-in) com o llama.cpp.

Estrelas
1.046
Bifurcações
90
Linguagem
Python
Licença
Último push
há 5 meses
Python

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.