Chuyển tới nội dung chính
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Tăng tốc suy luận cho Long-context LLMs bằng cách tính toán thưa thớt xấp xỉ và động, giúp giảm độ trễ suy luận lên tới 10 lần khi pre-filling trên A100 mà vẫn duy trì độ chính xác.

Sao
1.226
Fork
80
Ngôn ngữ
Python
Giấy phép
MIT
Push gần nhất
5 tháng trước
Python

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.