跳到主要內容
buildradar
Sign in

intel/neural-compressor

@intel

領先的低位元大型語言模型(LLM)量化(INT8/FP8/MXFP8/INT4/MXFP4/NVFP4)與稀疏化技術;基於 PyTorch、TensorFlow 和 ONNX Runtime 的頂尖模型壓縮技術

星數
2,706
Fork 數
322
語言
Python
授權
Apache-2.0
最後推送
1 週前
Pythonlarge-language-modelsquantizationknowledge-distillationsparsitypruningpost-training-quantizationawqsmoothquantint4quantization-aware-traininggptqfp4auto-tuningint8low-precisionmxformatsparsegpt

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。