Aller au contenu principal
buildradar
Sign in

intel/neural-compressor

@intel

Quantification LLM faible bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) et sparsité ; techniques de compression de modèles de pointe pour PyTorch, TensorFlow et ONNX Runtime.

Étoiles
2 706
Bifurcations
322
Langage
Python
Licence
Apache-2.0
Dernier push
il y a 6 jours
Pythonlarge-language-modelsquantizationknowledge-distillationsparsitypruningpost-training-quantizationawqsmoothquantint4quantization-aware-traininggptqfp4auto-tuningint8low-precisionmxformatsparsegpt

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.