Pular para o conteúdo principal
buildradar
Sign in

intel/neural-compressor

@intel

Quantização SOTA de LLM de baixo bit (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) e esparsidade; técnicas líderes de compressão de modelos em PyTorch, TensorFlow e ONNX Runtime.

Estrelas
2.706
Bifurcações
322
Linguagem
Python
Licença
Apache-2.0
Último push
há 6 dias
Pythonlarge-language-modelsquantizationknowledge-distillationsparsitypruningpost-training-quantizationawqsmoothquantint4quantization-aware-traininggptqfp4auto-tuningint8low-precisionmxformatsparsegpt

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.