microsoft/LLMLingua
@microsoft[EMNLP'23, ACL'24] Para acelerar a inferência de LLMs e aprimorar a percepção de informações-chave pelo LLM, comprime o prompt e o KV-Cache, alcançando até 20x de compressão com perda mínima de desempenho.
Estrelas
6.623
Bifurcações
420
Linguagem
Python
Licença
MIT
Último push
há 5 meses
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.