Chuyển tới nội dung chính
buildradar
Sign in

IST-DASLab/marlin

@IST-DASLab

Kernel suy luận LLM FP16xINT4 có thể đạt tốc độ nhanh gấp ~4 lần gần như lý tưởng với kích thước batch trung bình từ 16-32 token.

Sao
1.138
Fork
92
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
2 năm trước
Pythonllmquantizationkernel4bit

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.