Chuyển tới nội dung chính
buildradar
Đăng nhập

syv-ai/qwen38-27b-rtx3090

@syv-ai

Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.

Sao
1.284
Fork
181
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
4 giờ trước
Pythonllm-inferencevllmlocal-llmqwenquantizationkv-cachespeculative-decodingqwen3rtx-3090

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.