Chuyển tới nội dung chính
buildradar
Đăng nhập

weicj/vLLM-2080Ti-Definitive

@weicj

Runtime vLLM tối ưu cho cấu hình dual RTX 2080 Ti 22GB + NVLink, cung cấp khả năng suy luận cục bộ Qwen 27B với tốc độ giải mã tối đa hơn 100 tok/s cho một yêu cầu, hỗ trợ trọng số FP8.

Sao
828
Fork
124
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
2 ngày trước
Python

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.