Saltar al contenido principal
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Para acelerar la inferencia de LLMs de contexto largo, calcula la atención de manera aproximada y dispersa dinámica, lo que reduce la latencia de inferencia hasta 10 veces en el pre-llenado en una A100 manteniendo la precisión.

Estrellas
1226
Bifurcaciones
80
Lenguaje
Python
Licencia
MIT
Último push
hace 5 meses
Python

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.