Lompat ke konten utama
buildradar
Masuk

weicj/vLLM-2080Ti-Definitive

@weicj

Runtime vLLM definitif untuk dual RTX 2080 Ti 22GB + NVLink, menghadirkan inferensi lokal Qwen 27B dengan dekode permintaan tunggal maksimum 100+ tok/s dengan dukungan bobot FP8

Bintang
828
Fork
124
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
2 hari yang lalu
Python

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.