0xSero/turboquant
@0xSeroTurboQuant: Kuantisasi KV cache yang hampir optimal untuk inferensi LLM (kunci 3-bit, nilai 2-bit) dengan kernel Triton + integrasi vLLM
Bintang
1.753
Fork
195
Bahasa
Python
Lisensi
GPL-3.0
Push terakhir
5 bulan yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.