Pular para o conteúdo principal
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant: Quantização de cache KV quase otimizada para inferência de LLM (chaves de 3 bits, valores de 2 bits) com kernels Triton + integração vLLM

Estrelas
1.753
Bifurcações
195
Linguagem
Python
Licença
GPL-3.0
Último push
há 5 meses
Python

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.