Saltar al contenido principal
buildradar
Iniciar sesión

ztxz16/fastllm

@ztxz16

fastllm es una biblioteca de inferencia de modelos de lenguaje grandes de alto rendimiento y sin dependencias de backend. Admite inferencia paralela de tensores para modelos densos e inferencia en modo mixto para modelos MOE. Permite ejecutar modelos DeepSeek completos en cualquier tarjeta gráfica con más de 10 GB de VRAM. En un servidor con doble Epyc 9004/9005 y una sola GPU, despliega el modelo original de DeepSeek en precisión completa logrando 20 tps con una sola concurrencia; la versión cuantizada en INT4 alcanza 30 tps y más de 60 tps con múltiples concurrencias.

Estrellas
4954
Bifurcaciones
485
Lenguaje
C++
Licencia
Apache-2.0
Último push
hace 1 semana
C++

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.