Pular para o conteúdo principal
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Para acelerar a inferência de LLMs de contexto longo, o cálculo esparso aproximado e dinâmico da atenção reduz a latência de inferência em até 10x no pré-preenchimento em um A100, mantendo a precisão.

Estrelas
1.226
Bifurcações
80
Linguagem
Python
Licença
MIT
Último push
há 5 meses
Python

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.