Zum Hauptinhalt springen
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Beschleunigung der Inferenz von Long-Context-LLMs durch approximierte und dynamische spärliche Attention-Berechnung, wodurch die Latenz beim Pre-Filling auf einer A100 um bis zum 10-fachen reduziert wird bei gleichbleibender Genauigkeit.

Sterne
1.226
Forks
80
Sprache
Python
Lizenz
MIT
Letzter Push
vor 5 Monaten
Python

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.