0xSero/turboquant
@0xSeroTurboQuant: Quantização de cache KV quase otimizada para inferência de LLM (chaves de 3 bits, valores de 2 bits) com kernels Triton + integração vLLM
Estrelas
1.753
Bifurcações
195
Linguagem
Python
Licença
GPL-3.0
Último push
há 5 meses
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.