microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Para acelerar a inferência de LLMs de contexto longo, o cálculo esparso aproximado e dinâmico da atenção reduz a latência de inferência em até 10x no pré-preenchimento em um A100, mantendo a precisão.
Estrelas
1.226
Bifurcações
80
Linguagem
Python
Licença
MIT
Último push
há 5 meses
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.