quantization
Repositórios de código aberto acompanhados marcados com quantization, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de quantization no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com quantization.
- #1
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 6.905 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 552
- #1
Ajuste fino eficiente e unificado de mais de 100 LLMs e VLMs (ACL 2024)
★ 74.443+158Variação de estrelas nos últimos 7 dias - #2
Transcrição Whisper mais rápida com CTranslate2
★ 25.135+108Variação de estrelas nos últimos 7 dias - #3
Modelos de linguagem LLaMA & Alpaca para chinês + treinamento e implantação local em CPU/GPU
★ 18.934+2Variação de estrelas nos últimos 7 dias - #4
[🔥atualizando ...] Robô de negociação quantitativa automática com IA (implantação totalmente local). Plataforma de pesquisa de investimento quantitativo baseada em IA. 📃 documentação online: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18.418+46Variação de estrelas nos últimos 7 dias - #5
Um índice vetorial construído sobre TurboQuant, escrito em Rust com bindings para Python.
★ 16.518+308Variação de estrelas nos últimos 7 dias - #6
Modelos de linguagem grandes acessíveis via quantização de k-bit para PyTorch.
★ 8.446+16Variação de estrelas nos últimos 7 dias - #7
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 6.905+485Variação de estrelas nos últimos 7 dias - #8
Compressor de PNG com perdas — comando pngquant baseado na biblioteca libimagequant
★ 5.744+4Variação de estrelas nos últimos 7 dias - #9
Motor de inferência rápida para modelos Transformer.
★ 4.651+23Variação de estrelas nos últimos 7 dias - #10
[ICLR2025 Spotlight] SVDQuant: Absorvendo outliers por componentes de baixo posto para modelos de difusão de 4 bits
★ 3.937+1Variação de estrelas nos últimos 7 dias - #11
Biblioteca compatível com Transformers para aplicar vários algoritmos de compressão a LLMs para implantação otimizada com vLLM
★ 3.736+27Variação de estrelas nos últimos 7 dias - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] O Quantized Attention alcança uma aceleração de 2 a 5 vezes em comparação ao FlashAttention, sem perda de métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.
★ 3.685+23Variação de estrelas nos últimos 7 dias - #13
🚀 Acelere a inferência e o treinamento de 🤗 Transformers, Diffusers, TIMM e Sentence Transformers com ferramentas de otimização de hardware fáceis de usar
★ 3.473+9Variação de estrelas nos últimos 7 dias - #14
Modelo de linguagem pré-treinado e suas técnicas de otimização relacionadas desenvolvidas pelo Huawei Noah's Ark Lab.
★ 3.166+1Variação de estrelas nos últimos 7 dias - #15★ 2.959+7Variação de estrelas nos últimos 7 dias
- #16
Plugin do Nunchaku para o ComfyUI
★ 2.920+2Variação de estrelas nos últimos 7 dias - #17
Seu guia de consulta rápida para entrevistas de Engenharia de IA – Perguntas e Respostas.
★ 2.888+112Variação de estrelas nos últimos 7 dias - #18
Quantização SOTA de LLM de baixo bit (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) e esparsidade; técnicas líderes de compressão de modelos em PyTorch, TensorFlow e ONNX Runtime.
★ 2.706+5Variação de estrelas nos últimos 7 dias - #19
AIMET é uma biblioteca que fornece técnicas avançadas de quantização e compressão para modelos de redes neurais treinados.
★ 2.690+7Variação de estrelas nos últimos 7 dias - #20
Construa, personalize e controle seus próprios LLMs. Do pré-processamento de dados ao fine-tuning, o xTuring oferece uma maneira fácil de personalizar LLMs de código aberto.
★ 2.674+0Variação de estrelas nos últimos 7 dias - #21
Uma lista de artigos, documentos e códigos sobre quantização de modelos. Este repositório visa fornecer informações para pesquisa em quantização de modelos e está em constante melhoria. Contribuições (PRs) de trabalhos ausentes são bem-vindas.
★ 2.433+4Variação de estrelas nos últimos 7 dias - #22
Dominando IA aplicada, um conceito de cada vez.
★ 2.377-1Variação de estrelas nos últimos 7 dias - #23
Execute modelos Mixtral-8x7B no Colab ou em desktops domésticos.
★ 2.333+1Variação de estrelas nos últimos 7 dias - #24
micronet, uma biblioteca de compressão e implantação de modelos. Compressão: 1. Quantização: QAT, High-Bit (>2b), Low-Bit (≤2b)/Ternary e Binary (TWN/BNN/XNOR-Net); PTQ, 8-bit (tensorrt); 2. Poda: normal, regular e poda de canal convolucional em grupo.
★ 2.266+0Variação de estrelas nos últimos 7 dias - #25
Execute um LLM de 1 bilhão de parâmetros em uma placa de 10 dólares com 256 MB de RAM
★ 1.923+6Variação de estrelas nos últimos 7 dias - #26
PPL Quantization Tool (PPQ) é uma poderosa ferramenta offline de quantização de redes neurais.
★ 1.817+2Variação de estrelas nos últimos 7 dias - #27★ 1.682+0Variação de estrelas nos últimos 7 dias
- #28
PaddleSlim é uma biblioteca de código aberto para compressão de modelos profundos e busca de arquitetura.
★ 1.612+1Variação de estrelas nos últimos 7 dias - #29
Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.
★ 1.594+15Variação de estrelas nos últimos 7 dias - #30★ 1.579-1Variação de estrelas nos últimos 7 dias