microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Beschleunigung der Inferenz von Long-Context-LLMs durch approximierte und dynamische spärliche Attention-Berechnung, wodurch die Latenz beim Pre-Filling auf einer A100 um bis zum 10-fachen reduziert wird bei gleichbleibender Genauigkeit.
Sterne
1.226
Forks
80
Sprache
Python
Lizenz
MIT
Letzter Push
vor 5 Monaten
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.