Lompat ke konten utama
buildradar
Sign in

microsoft/MInference

@microsoft

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Untuk mempercepat inferensi LLM konteks panjang, kalkulasi jarang yang aproksimatif dan dinamis pada perhatian, yang mengurangi latensi inferensi hingga 10x lipat untuk pra-pengisian pada A100 dengan tetap menjaga akurasi.

Bintang
1.226
Fork
80
Bahasa
Python
Lisensi
MIT
Push terakhir
5 bulan yang lalu
Python

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.