IST-DASLab/marlin
@IST-DASLabKernel inferensi LLM FP16xINT4 yang dapat mencapai percepatan ~4x yang mendekati ideal hingga ukuran batch sedang 16-32 token.
Bintang
1.138
Fork
92
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
2 tahun yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.