weicj/vLLM-2080Ti-Definitive
@weicjRuntime vLLM definitif untuk dual RTX 2080 Ti 22GB + NVLink, menghadirkan inferensi lokal Qwen 27B dengan dekode permintaan tunggal maksimum 100+ tok/s dengan dukungan bobot FP8
Bintang
828
Fork
124
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
2 hari yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.