0xSero/turboquant
@0xSeroTurboQuant: Lượng tử hóa bộ nhớ đệm KV tối ưu gần như hoàn hảo cho suy luận LLM (khóa 3-bit, giá trị 2-bit) với nhân Triton kết hợp tích hợp vLLM
Sao
1.753
Fork
195
Ngôn ngữ
Python
Giấy phép
GPL-3.0
Push gần nhất
5 tháng trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.