Lompat ke konten utama
buildradar
Masuk

syv-ai/qwen38-27b-rtx3090

@syv-ai

Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

Bintang
1.284
Fork
181
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
5 jam yang lalu
Pythonllm-inferencevllmlocal-llmqwenquantizationkv-cachespeculative-decodingqwen3rtx-3090

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.