quantization
Repositórios de código aberto acompanhados marcados com quantization, ordenados por estrelas.
- #31★ 1.579+0Variação de estrelas nos últimos 7 dias
- #32
Um kit de ferramentas para otimizar modelos de ML para implantação em Keras e TensorFlow, incluindo quantização e poda.
★ 1.578+0Variação de estrelas nos últimos 7 dias - #33★ 1.568+1Variação de estrelas nos últimos 7 dias
- #34
Calcule tokens/s e requisitos de memória GPU para qualquer LLM. Suporta quantização llama.cpp/ggml/bnb/QLoRA.
★ 1.406+0Variação de estrelas nos últimos 7 dias - #35
Construa modelos de visão computacional em uma fração do tempo e com menos dados.
★ 1.325+5Variação de estrelas nos últimos 7 dias - #36
Métodos de computação eficiente desenvolvidos pelo Huawei Noah's Ark Lab
★ 1.307+0Variação de estrelas nos últimos 7 dias - #37
Kit de ferramentas de quantização (compressão) de modelos LLM com suporte a aceleração de hardware para GPUs Nvidia, AMD, Intel e CPUs Intel/AMD/Apple via HF, vLLM e SGLang.
★ 1.248+0Variação de estrelas nos últimos 7 dias - #38
Framework de compressão de redes neurais para inferência aprimorada com OpenVINO™
★ 1.197+4Variação de estrelas nos últimos 7 dias - #39
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.185+285Variação de estrelas nos últimos 7 dias - #40
Kernel de inferência LLM FP16xINT4 capaz de atingir acelerações quase ideais de ~4x para tamanhos de lote médios de 16-32 tokens.
★ 1.138+2Variação de estrelas nos últimos 7 dias - #41
Z80-μLM é um modelo de linguagem quantizado de 2 bits pequeno o suficiente para rodar em um processador Z80 de 8 bits. Treine modelos conversacionais em Python, exporte-os como binários .COM para CP/M e converse com seu computador antigo.
★ 1.119+2Variação de estrelas nos últimos 7 dias - #42
Um backend de quantização PyTorch para o optimum
★ 1.053-1Variação de estrelas nos últimos 7 dias - #43★ 1.049+4Variação de estrelas nos últimos 7 dias
- #44
[ICML2025] SpargeAttention: Uma atenção esparsa livre de treinamento que acelera a inferência de qualquer modelo.
★ 1.043+1Variação de estrelas nos últimos 7 dias - #45
Uma ferramenta para converter arquivos ONNX para LiteRT/TFLite/TensorFlow, código nativo PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) e Dynamo ONNX. Também suporta conversão direta de LiteRT para PyTorch.
★ 992+2Variação de estrelas nos últimos 7 dias - #46
TinyChatEngine: Biblioteca de inferência de LLM em dispositivos
★ 961+0Variação de estrelas nos últimos 7 dias - #47★ 958+3Variação de estrelas nos últimos 7 dias
- #48
[NeurIPS 2020] MCUNet: Tiny Deep Learning on IoT Devices; [NeurIPS 2021] MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device Training Under 256KB Memory
★ 957+3Variação de estrelas nos últimos 7 dias - #49
Biblioteca de quantização de paleta que alimenta o pngquant e outros otimizadores de PNG
★ 930+1Variação de estrelas nos últimos 7 dias - #50
[Destaque ICLR2024] OmniQuant é uma técnica de quantização simples e poderosa para LLMs.
★ 918+8Variação de estrelas nos últimos 7 dias - #51
Lista de artigos relacionados à quantização de redes neurais em conferências e periódicos recentes de IA.
★ 851+6Variação de estrelas nos últimos 7 dias - #52
[EMNLP 2024 & AAAI 2026] Um poderoso kit de ferramentas para compressão de grandes modelos, incluindo LLMs, VLMs e modelos gerativos de vídeo.
★ 747+4Variação de estrelas nos últimos 7 dias - #53
[ICML 2024] SqueezeLLM: Quantização densa e esparsa
★ 724+1Variação de estrelas nos últimos 7 dias - #54
O Hailo Model Zoo inclui modelos pré-treinados e um ambiente completo de construção e avaliação.
★ 704+2Variação de estrelas nos últimos 7 dias - #55
Bem-vindo ao repositório oficial do SINQ! Um método de quantização inovador, rápido e de alta qualidade projetado para tornar qualquer Large Language Model menor, preservando a precisão [ICML 2026]
★ 630+1Variação de estrelas nos últimos 7 dias - #56★ 608+42Variação de estrelas nos últimos 7 dias
- #57
Pesquisa semântica off-line de Texto para Imagem e Imagem para Imagem no Android, impulsionada pelo modelo CLIP pré-treinado de visão e linguagem de última geração quantizado e pelo motor de inferência ONNX Runtime
★ 599+1Variação de estrelas nos últimos 7 dias - #58★ 584+0Variação de estrelas nos últimos 7 dias
- #59
Ferramenta para onnx->keras ou onnx->tflite. Esperamos que esta ferramenta possa ajudar você.
★ 579+0Variação de estrelas nos últimos 7 dias - #60
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Variação de estrelas nos últimos 7 dias