Pular para o conteúdo principal
buildradar
Sign in
Tópico · quantization

quantization

Repositórios de código aberto acompanhados marcados com quantization, ordenados por estrelas.

62 repositórios
  • rwkv.cpp@RWKV

    Inferência INT4/INT5/INT8 e FP16 em CPU para o modelo de linguagem RWKV

    1.579+0Variação de estrelas nos últimos 7 dias
  • model-optimization@tensorflow

    Um kit de ferramentas para otimizar modelos de ML para implantação em Keras e TensorFlow, incluindo quantização e poda.

    1.578+0Variação de estrelas nos últimos 7 dias
  • brevitas@Xilinx

    Brevitas: quantização de redes neurais em PyTorch.

    1.568+1Variação de estrelas nos últimos 7 dias
  • gpu_poor@RahulSChand

    Calcule tokens/s e requisitos de memória GPU para qualquer LLM. Suporta quantização llama.cpp/ggml/bnb/QLoRA.

    1.406+0Variação de estrelas nos últimos 7 dias
  • geti@open-edge-platform

    Construa modelos de visão computacional em uma fração do tempo e com menos dados.

    1.325+5Variação de estrelas nos últimos 7 dias
  • Efficient-Computing@huawei-noah

    Métodos de computação eficiente desenvolvidos pelo Huawei Noah's Ark Lab

    1.307+0Variação de estrelas nos últimos 7 dias
  • GPTQModel@ModelCloud

    Kit de ferramentas de quantização (compressão) de modelos LLM com suporte a aceleração de hardware para GPUs Nvidia, AMD, Intel e CPUs Intel/AMD/Apple via HF, vLLM e SGLang.

    1.248+0Variação de estrelas nos últimos 7 dias
  • nncf@openvinotoolkit

    Framework de compressão de redes neurais para inferência aprimorada com OpenVINO™

    1.197+4Variação de estrelas nos últimos 7 dias
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.185+285Variação de estrelas nos últimos 7 dias
  • marlin@IST-DASLab

    Kernel de inferência LLM FP16xINT4 capaz de atingir acelerações quase ideais de ~4x para tamanhos de lote médios de 16-32 tokens.

    1.138+2Variação de estrelas nos últimos 7 dias
  • z80ai@HarryR

    Z80-μLM é um modelo de linguagem quantizado de 2 bits pequeno o suficiente para rodar em um processador Z80 de 8 bits. Treine modelos conversacionais em Python, exporte-os como binários .COM para CP/M e converse com seu computador antigo.

    1.119+2Variação de estrelas nos últimos 7 dias
  • optimum-quanto@huggingface

    Um backend de quantização PyTorch para o optimum

    1.053-1Variação de estrelas nos últimos 7 dias
  • finn@Xilinx

    Compilador de fluxo de dados para inferência QNN em FPGAs

    1.049+4Variação de estrelas nos últimos 7 dias
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Uma atenção esparsa livre de treinamento que acelera a inferência de qualquer modelo.

    1.043+1Variação de estrelas nos últimos 7 dias
  • onnx2tf@PINTO0309

    Uma ferramenta para converter arquivos ONNX para LiteRT/TFLite/TensorFlow, código nativo PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) e Dynamo ONNX. Também suporta conversão direta de LiteRT para PyTorch.

    992+2Variação de estrelas nos últimos 7 dias
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: Biblioteca de inferência de LLM em dispositivos

    961+0Variação de estrelas nos últimos 7 dias
  • hqq@dropbox

    Implementação oficial de Half-Quadratic Quantization (HQQ)

    958+3Variação de estrelas nos últimos 7 dias
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: Tiny Deep Learning on IoT Devices; [NeurIPS 2021] MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device Training Under 256KB Memory

    957+3Variação de estrelas nos últimos 7 dias
  • libimagequant@ImageOptim

    Biblioteca de quantização de paleta que alimenta o pngquant e outros otimizadores de PNG

    930+1Variação de estrelas nos últimos 7 dias
  • OmniQuant@OpenGVLab

    [Destaque ICLR2024] OmniQuant é uma técnica de quantização simples e poderosa para LLMs.

    918+8Variação de estrelas nos últimos 7 dias
  • Lista de artigos relacionados à quantização de redes neurais em conferências e periódicos recentes de IA.

    851+6Variação de estrelas nos últimos 7 dias
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Um poderoso kit de ferramentas para compressão de grandes modelos, incluindo LLMs, VLMs e modelos gerativos de vídeo.

    747+4Variação de estrelas nos últimos 7 dias
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: Quantização densa e esparsa

    724+1Variação de estrelas nos últimos 7 dias
  • hailo_model_zoo@hailo-ai

    O Hailo Model Zoo inclui modelos pré-treinados e um ambiente completo de construção e avaliação.

    704+2Variação de estrelas nos últimos 7 dias
  • SINQ@huawei-csl

    Bem-vindo ao repositório oficial do SINQ! Um método de quantização inovador, rápido e de alta qualidade projetado para tornar qualquer Large Language Model menor, preservando a precisão [ICML 2026]

    630+1Variação de estrelas nos últimos 7 dias
  • hipfire@warpfront

    Motor de inferência de LLM nativo para RDNA escrito em Rust.

    608+42Variação de estrelas nos últimos 7 dias
  • tidy@slavabarkov

    Pesquisa semântica off-line de Texto para Imagem e Imagem para Imagem no Android, impulsionada pelo modelo CLIP pré-treinado de visão e linguagem de última geração quantizado e pelo motor de inferência ONNX Runtime

    599+1Variação de estrelas nos últimos 7 dias
  • qkeras@google

    QKeras: uma biblioteca de aprendizado profundo de quantização para Tensorflow Keras

    584+0Variação de estrelas nos últimos 7 dias
  • onnx2tflite@MPolaris

    Ferramenta para onnx->keras ou onnx->tflite. Esperamos que esta ferramenta possa ajudar você.

    579+0Variação de estrelas nos últimos 7 dias
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+30Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos