Pular para o conteúdo principal
buildradar
Entrar

weicj/vLLM-2080Ti-Definitive

@weicj

O runtime vLLM definitivo para duas RTX 2080 Ti de 22GB + NVLink, oferecendo inferência local do Qwen 27B com decodificação de requisição única máxima de mais de 100 tok/s e suporte a pesos FP8

Estrelas
828
Bifurcações
124
Linguagem
Python
Licença
Apache-2.0
Último push
há 1 dia
Python

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.