weicj/vLLM-2080Ti-Definitive
@weicjO runtime vLLM definitivo para duas RTX 2080 Ti de 22GB + NVLink, oferecendo inferência local do Qwen 27B com decodificação de requisição única máxima de mais de 100 tok/s e suporte a pesos FP8
Estrelas
828
Bifurcações
124
Linguagem
Python
Licença
Apache-2.0
Último push
há 1 dia
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.