跳到主要内容
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] 为了加速长上下文 LLM 的推理,采用近似与动态稀疏计算注意力机制,在 A100 上进行预填充时可将推理延迟降低高达 10 倍,同时保持准确度。

星数
1,226
Fork 数
80
语言
Python
许可
MIT
最后推送
5个月前
Python

还没有相关情报

radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。