weicj/vLLM-2080Ti-Definitive
@weicjRuntime vLLM tối ưu cho cấu hình dual RTX 2080 Ti 22GB + NVLink, cung cấp khả năng suy luận cục bộ Qwen 27B với tốc độ giải mã tối đa hơn 100 tok/s cho một yêu cầu, hỗ trợ trọng số FP8.
Sao
828
Fork
124
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
2 ngày trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.