scrya-com/rotorquant
@scrya-comKompresi cache KV melalui rotasi blok-diagonal. Mengungguli TurboQuant: PPL lebih baik (6,91 vs 7,07), dekode 28% lebih cepat, prefill 5,3x lebih cepat, parameter 44x lebih sedikit. Integrasi drop-in untuk llama.cpp.
Bintang
1.046
Fork
90
Bahasa
Python
Lisensi
—
Push terakhir
5 bulan yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.