microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Tăng tốc suy luận cho Long-context LLMs bằng cách tính toán thưa thớt xấp xỉ và động, giúp giảm độ trễ suy luận lên tới 10 lần khi pre-filling trên A100 mà vẫn duy trì độ chính xác.
Sao
1.226
Fork
80
Ngôn ngữ
Python
Giấy phép
MIT
Push gần nhất
5 tháng trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.