Lompat ke konten utama
buildradar
Sign in

IST-DASLab/marlin

@IST-DASLab

Kernel inferensi LLM FP16xINT4 yang dapat mencapai percepatan ~4x yang mendekati ideal hingga ukuran batch sedang 16-32 token.

Bintang
1.138
Fork
92
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
2 tahun yang lalu
Pythonllmquantizationkernel4bit

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.