weicj/vLLM-2080Ti-Definitive
@weicjEl runtime vLLM definitivo para configuraciones duales RTX 2080 Ti 22GB + NVLink, que permite la inferencia local de Qwen 27B con una velocidad máxima de decodificación de más de 100 tok/s por solicitud y soporte para pesos FP8.
Estrellas
828
Bifurcaciones
124
Lenguaje
Python
Licencia
Apache-2.0
Último push
hace 2 días
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.