Chuyển tới nội dung chính
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant: Lượng tử hóa bộ nhớ đệm KV tối ưu gần như hoàn hảo cho suy luận LLM (khóa 3-bit, giá trị 2-bit) với nhân Triton kết hợp tích hợp vLLM

Sao
1.753
Fork
195
Ngôn ngữ
Python
Giấy phép
GPL-3.0
Push gần nhất
5 tháng trước
Python

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.