microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] Pour accélérer l'inférence des LLM à long contexte, calcul d'attention approximatif et dynamiquement creux, réduisant la latence d'inférence jusqu'à 10x lors du pré-remplissage sur A100 tout en maintenant la précision.
Étoiles
1 226
Bifurcations
80
Langage
Python
Licence
MIT
Dernier push
il y a 5 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.