メインコンテンツへスキップ
buildradar
Sign in

intel/neural-compressor

@intel

SOTA 低ビット LLM 量子化 (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) とスパース性;PyTorch、TensorFlow、ONNX Runtime における主要なモデル圧縮技術

スター
2,706
フォーク
322
言語
Python
ライセンス
Apache-2.0
最終プッシュ
5 日前
Pythonlarge-language-modelsquantizationknowledge-distillationsparsitypruningpost-training-quantizationawqsmoothquantint4quantization-aware-traininggptqfp4auto-tuningint8low-precisionmxformatsparsegpt

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。