microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Para acelerar la inferencia de LLMs de contexto largo, calcula la atención de manera aproximada y dispersa dinámica, lo que reduce la latencia de inferencia hasta 10 veces en el pre-llenado en una A100 manteniendo la precisión.
Estrellas
1226
Bifurcaciones
80
Lenguaje
Python
Licencia
MIT
Último push
hace 5 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.