Saltar al contenido principal
buildradar
Iniciar sesión

weicj/vLLM-2080Ti-Definitive

@weicj

El runtime vLLM definitivo para configuraciones duales RTX 2080 Ti 22GB + NVLink, que permite la inferencia local de Qwen 27B con una velocidad máxima de decodificación de más de 100 tok/s por solicitud y soporte para pesos FP8.

Estrellas
828
Bifurcaciones
124
Lenguaje
Python
Licencia
Apache-2.0
Último push
hace 2 días
Python

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.