跳到主要內容
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] 為了加速長上下文 LLM 的推論,採用近似與動態稀疏計算注意力機制,在 A100 上進行預填時可將推論延遲降低高達 10 倍,同時維持準確度。

星數
1,226
Fork 數
80
語言
Python
授權
MIT
最後推送
5 個月前
Python

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。