Aller au contenu principal
buildradar
Sign in

intel/auto-round

@intel

Un algorithme de quantification SOTA pour l'inférence LLM basse précision haute précision, optimisé pour CPU/XPU/CUDA, avec support multi-type et compatibilité totale avec vLLM, SGLang et Transformers.

Étoiles
1 594
Bifurcations
168
Langage
Python
Licence
Apache-2.0
Dernier push
il y a 1 jour
Pythonvllmllmstransformersquantizationggufomnidiffuserssglangnvfp4int4vlmsmxfp4rounding

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.