microsoft/LLMLingua
@microsoft[EMNLP'23, ACL'24] Para acelerar la inferencia de los LLM y mejorar la percepción de la información clave del LLM, comprime el prompt y el KV-Cache, lo que logra hasta 20 veces de compresión con una pérdida mínima de rendimiento.
Estrellas
6623
Bifurcaciones
420
Lenguaje
Python
Licencia
MIT
Último push
hace 5 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.