ztxz16/fastllm
@ztxz16fastllm es una biblioteca de inferencia de modelos de lenguaje grandes de alto rendimiento y sin dependencias de backend. Admite inferencia paralela de tensores para modelos densos e inferencia en modo mixto para modelos MOE. Permite ejecutar modelos DeepSeek completos en cualquier tarjeta gráfica con más de 10 GB de VRAM. En un servidor con doble Epyc 9004/9005 y una sola GPU, despliega el modelo original de DeepSeek en precisión completa logrando 20 tps con una sola concurrencia; la versión cuantizada en INT4 alcanza 30 tps y más de 60 tps con múltiples concurrencias.
Estrellas
4954
Bifurcaciones
485
Lenguaje
C++
Licencia
Apache-2.0
Último push
hace 1 semana
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.