ztxz16/fastllm
@ztxz16fastllm adalah pustaka inferensi LLM berkinerja tinggi tanpa dependensi backend. Mendukung inferensi paralel tensor untuk model padat dan inferensi mode campuran untuk model MoE, memungkinkan inferensi DeepSeek penuh pada kartu grafis apa pun di atas 10G. Menyebarkan model asli presisi penuh DeepSeek pada server dual-socket 9004/9005 dengan satu GPU menghasilkan 20 tps untuk satu konkurensi; model kuantisasi INT4 mencapai 30 tps untuk satu konkurensi, dan konkurensi multi dapat mencapai 60+.
Bintang
4.954
Fork
485
Bahasa
C++
Lisensi
Apache-2.0
Push terakhir
1 minggu yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.