Pular para o conteúdo principal
buildradar
Entrar

tonbistudio/turboquant-pytorch

@tonbistudio

Implementação do zero em PyTorch do TurboQuant do Google (ICLR 2026) para compressão de KV cache em LLMs. Compressão de 5x em 3-bit com 99,5% de fidelidade de atenção.

Estrelas
1.044
Bifurcações
139
Linguagem
Python
Licença
MIT
Último push
há 5 meses
Python

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.