Lompat ke konten utama
buildradar
Sign in

0xSero/turboquant

@0xSero

TurboQuant: Kuantisasi KV cache yang hampir optimal untuk inferensi LLM (kunci 3-bit, nilai 2-bit) dengan kernel Triton + integrasi vLLM

Bintang
1.753
Fork
195
Bahasa
Python
Lisensi
GPL-3.0
Push terakhir
5 bulan yang lalu
Python

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.