ztxz16/fastllm
@ztxz16fastllm est une bibliothèque d'inférence de grands modèles de langage haute performance sans dépendances backend. Elle prend en charge le parallélisme tensoriel pour les modèles denses et l'inférence en mode mixte pour les modèles MOE, permettant d'exécuter DeepSeek sur n'importe quelle carte graphique de plus de 10 Go.
Étoiles
4 954
Bifurcations
485
Langage
C++
Licence
Apache-2.0
Dernier push
il y a 1 semaine
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.