Zum Hauptinhalt springen
buildradar
Sign in

intel/neural-compressor

@intel

SOTA Low-Bit-LLM-Quantisierung (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) und Sparsity; führende Modellkompressionstechniken für PyTorch, TensorFlow und ONNX Runtime

Sterne
2.706
Forks
322
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 6 Tagen
Pythonlarge-language-modelsquantizationknowledge-distillationsparsitypruningpost-training-quantizationawqsmoothquantint4quantization-aware-traininggptqfp4auto-tuningint8low-precisionmxformatsparsegpt

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.