Pular para o conteúdo principal
buildradar
Sign in
Tópico · quantization

quantization

Repositórios de código aberto acompanhados marcados com quantization, ordenados por estrelas.

Repositórios
62
Total de estrelas
264.169
Média de estrelas
4.261
Participação
0,01%

Tópicos que aparecem com frequência ao lado de quantization no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com quantization.

  • kimi-k3-in-c@FareedKhan-dev

    Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.

    6.905
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    552
  • LlamaFactory@hiyouga

    Ajuste fino eficiente e unificado de mais de 100 LLMs e VLMs (ACL 2024)

    74.443+158Variação de estrelas nos últimos 7 dias
  • faster-whisper@SYSTRAN

    Transcrição Whisper mais rápida com CTranslate2

    25.135+108Variação de estrelas nos últimos 7 dias
  • Modelos de linguagem LLaMA & Alpaca para chinês + treinamento e implantação local em CPU/GPU

    18.934+2Variação de estrelas nos últimos 7 dias
  • Qbot@UFund-Me

    [🔥atualizando ...] Robô de negociação quantitativa automática com IA (implantação totalmente local). Plataforma de pesquisa de investimento quantitativo baseada em IA. 📃 documentação online: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant

    18.418+46Variação de estrelas nos últimos 7 dias
  • turbovec@RyanCodrai

    Um índice vetorial construído sobre TurboQuant, escrito em Rust com bindings para Python.

    16.518+308Variação de estrelas nos últimos 7 dias
  • bitsandbytes@bitsandbytes-foundation

    Modelos de linguagem grandes acessíveis via quantização de k-bit para PyTorch.

    8.446+16Variação de estrelas nos últimos 7 dias
  • kimi-k3-in-c@FareedKhan-dev

    Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.

    6.905+485Variação de estrelas nos últimos 7 dias
  • pngquant@kornelski

    Compressor de PNG com perdas — comando pngquant baseado na biblioteca libimagequant

    5.744+4Variação de estrelas nos últimos 7 dias
  • CTranslate2@OpenNMT

    Motor de inferência rápida para modelos Transformer.

    4.651+23Variação de estrelas nos últimos 7 dias
  • nunchaku@nunchaku-ai

    [ICLR2025 Spotlight] SVDQuant: Absorvendo outliers por componentes de baixo posto para modelos de difusão de 4 bits

    3.937+1Variação de estrelas nos últimos 7 dias
  • llm-compressor@vllm-project

    Biblioteca compatível com Transformers para aplicar vários algoritmos de compressão a LLMs para implantação otimizada com vLLM

    3.736+27Variação de estrelas nos últimos 7 dias
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] O Quantized Attention alcança uma aceleração de 2 a 5 vezes em comparação ao FlashAttention, sem perda de métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.

    3.685+23Variação de estrelas nos últimos 7 dias
  • optimum@huggingface

    🚀 Acelere a inferência e o treinamento de 🤗 Transformers, Diffusers, TIMM e Sentence Transformers com ferramentas de otimização de hardware fáceis de usar

    3.473+9Variação de estrelas nos últimos 7 dias
  • Modelo de linguagem pré-treinado e suas técnicas de otimização relacionadas desenvolvidas pelo Huawei Noah's Ark Lab.

    3.166+1Variação de estrelas nos últimos 7 dias
  • ao@pytorch

    Quantização nativa em PyTorch para treinamento e inferência.

    2.959+7Variação de estrelas nos últimos 7 dias
  • ComfyUI-nunchaku@nunchaku-ai

    Plugin do Nunchaku para o ComfyUI

    2.920+2Variação de estrelas nos últimos 7 dias
  • ai-engineering-interview-questions@amitshekhariitbhu

    Seu guia de consulta rápida para entrevistas de Engenharia de IA – Perguntas e Respostas.

    2.888+112Variação de estrelas nos últimos 7 dias
  • Quantização SOTA de LLM de baixo bit (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) e esparsidade; técnicas líderes de compressão de modelos em PyTorch, TensorFlow e ONNX Runtime.

    2.706+5Variação de estrelas nos últimos 7 dias
  • aimet@qualcomm

    AIMET é uma biblioteca que fornece técnicas avançadas de quantização e compressão para modelos de redes neurais treinados.

    2.690+7Variação de estrelas nos últimos 7 dias
  • xTuring@stochasticai

    Construa, personalize e controle seus próprios LLMs. Do pré-processamento de dados ao fine-tuning, o xTuring oferece uma maneira fácil de personalizar LLMs de código aberto.

    2.674+0Variação de estrelas nos últimos 7 dias
  • Uma lista de artigos, documentos e códigos sobre quantização de modelos. Este repositório visa fornecer informações para pesquisa em quantização de modelos e está em constante melhoria. Contribuições (PRs) de trabalhos ausentes são bem-vindas.

    2.433+4Variação de estrelas nos últimos 7 dias
  • AI-Engineering.academy@adithya-s-k

    Dominando IA aplicada, um conceito de cada vez.

    2.377-1Variação de estrelas nos últimos 7 dias
  • mixtral-offloading@dvmazur

    Execute modelos Mixtral-8x7B no Colab ou em desktops domésticos.

    2.333+1Variação de estrelas nos últimos 7 dias
  • micronet@666DZY666

    micronet, uma biblioteca de compressão e implantação de modelos. Compressão: 1. Quantização: QAT, High-Bit (>2b), Low-Bit (≤2b)/Ternary e Binary (TWN/BNN/XNOR-Net); PTQ, 8-bit (tensorrt); 2. Poda: normal, regular e poda de canal convolucional em grupo.

    2.266+0Variação de estrelas nos últimos 7 dias
  • picolm@RightNow-AI

    Execute um LLM de 1 bilhão de parâmetros em uma placa de 10 dólares com 256 MB de RAM

    1.923+6Variação de estrelas nos últimos 7 dias
  • ppq@OpenPPL

    PPL Quantization Tool (PPQ) é uma poderosa ferramenta offline de quantização de redes neurais.

    1.817+2Variação de estrelas nos últimos 7 dias
  • mmrazor@open-mmlab

    Caixa de ferramentas e benchmark de compressão de modelos OpenMMLab.

    1.682+0Variação de estrelas nos últimos 7 dias
  • PaddleSlim@PaddlePaddle

    PaddleSlim é uma biblioteca de código aberto para compressão de modelos profundos e busca de arquitetura.

    1.612+1Variação de estrelas nos últimos 7 dias
  • auto-round@intel

    Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.

    1.594+15Variação de estrelas nos últimos 7 dias
  • rwkv.cpp@RWKV

    Inferência INT4/INT5/INT8 e FP16 em CPU para o modelo de linguagem RWKV

    1.579-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos