Lompat ke konten utama
buildradar
Sign in

scrya-com/rotorquant

@scrya-com

Kompresi cache KV melalui rotasi blok-diagonal. Mengungguli TurboQuant: PPL lebih baik (6,91 vs 7,07), dekode 28% lebih cepat, prefill 5,3x lebih cepat, parameter 44x lebih sedikit. Integrasi drop-in untuk llama.cpp.

Bintang
1.046
Fork
90
Bahasa
Python
Lisensi
Push terakhir
5 bulan yang lalu
Python

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.