Pular para o conteúdo principal
buildradar
Sign in

intel/auto-round

@intel

Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.

Estrelas
1.599
Bifurcações
171
Linguagem
Python
Licença
Apache-2.0
Último push
há 5 dias
Pythonvllmllmstransformersquantizationggufomnidiffuserssglangnvfp4int4vlmsmxfp4rounding

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.