Lompat ke konten utama
buildradar
Sign in
Topik · quantization

quantization

Repositori open source terpantau bertanda quantization, diurutkan berdasarkan bintang.

62 repositori
  • rwkv.cpp@RWKV

    Inferensi INT4/INT5/INT8 dan FP16 pada CPU untuk model bahasa RWKV

    1.579+0Perubahan bintang dalam 7 hari terakhir
  • model-optimization@tensorflow

    Toolkit untuk mengoptimalkan model ML untuk penerapan pada Keras dan TensorFlow, termasuk kuantisasi dan pruning.

    1.578+0Perubahan bintang dalam 7 hari terakhir
  • brevitas@Xilinx

    Brevitas: kuantisasi jaringan saraf di PyTorch

    1.568+1Perubahan bintang dalam 7 hari terakhir
  • gpu_poor@RahulSChand

    Menghitung token/s & kebutuhan memori GPU untuk LLM apa pun. Mendukung kuantisasi llama.cpp/ggml/bnb/QLoRA

    1.406+0Perubahan bintang dalam 7 hari terakhir
  • geti@open-edge-platform

    Bangun model computer vision dalam waktu yang jauh lebih singkat dan dengan lebih sedikit data.

    1.325+5Perubahan bintang dalam 7 hari terakhir
  • Efficient-Computing@huawei-noah

    Metode komputasi efisien yang dikembangkan oleh Huawei Noah's Ark Lab

    1.307+0Perubahan bintang dalam 7 hari terakhir
  • GPTQModel@ModelCloud

    Toolkit kuantisasi (kompresi) model LLM dengan dukungan akselerasi HW untuk GPU Nvidia, AMD, Intel, dan CPU Intel/AMD/Apple melalui HF, vLLM, dan SGLang.

    1.248+0Perubahan bintang dalam 7 hari terakhir
  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.200+316Perubahan bintang dalam 7 hari terakhir
  • nncf@openvinotoolkit

    Kerangka Kerja Kompresi Jaringan Syaraf untuk inferensi OpenVINO™ yang ditingkatkan

    1.197+4Perubahan bintang dalam 7 hari terakhir
  • marlin@IST-DASLab

    Kernel inferensi LLM FP16xINT4 yang dapat mencapai percepatan ~4x yang mendekati ideal hingga ukuran batch sedang 16-32 token.

    1.138+2Perubahan bintang dalam 7 hari terakhir
  • z80ai@HarryR

    Z80-μLM adalah model bahasa terkuantisasi 2-bit yang cukup kecil untuk dijalankan pada prosesor Z80 8-bit. Latih model percakapan dengan Python, ekspor sebagai biner .COM CP/M, dan mengobrollah dengan komputer klasik Anda.

    1.119+2Perubahan bintang dalam 7 hari terakhir
  • finn@Xilinx

    Kompilator aliran data untuk inferensi QNN pada FPGA.

    1.053+8Perubahan bintang dalam 7 hari terakhir
  • optimum-quanto@huggingface

    Backend kuantisasi pytorch untuk optimum

    1.053-1Perubahan bintang dalam 7 hari terakhir
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Perhatian jarang tanpa pelatihan yang mempercepat inferensi model apa pun.

    1.045+3Perubahan bintang dalam 7 hari terakhir
  • onnx2tf@PINTO0309

    Alat untuk mengonversi file ONNX ke LiteRT/TFLite/TensorFlow, kode natif PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2), dan Dynamo ONNX. Alat ini juga mendukung konversi langsung dari LiteRT ke PyTorch.

    993+3Perubahan bintang dalam 7 hari terakhir
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: Pustaka Inferensi LLM Pada Perangkat

    961+0Perubahan bintang dalam 7 hari terakhir
  • hqq@dropbox

    Implementasi resmi dari Half-Quadratic Quantization (HQQ).

    958+3Perubahan bintang dalam 7 hari terakhir
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: Deep Learning Kecil pada Perangkat IoT; [NeurIPS 2021] MCUNetV2: Inferensi Berbasis Patch yang Efisien Memori untuk Deep Learning Kecil; [NeurIPS 2022] MCUNetV3: Pelatihan di Perangkat di Bawah Memori 256KB

    957+3Perubahan bintang dalam 7 hari terakhir
  • libimagequant@ImageOptim

    Pustaka kuantisasi palet yang mendukung pngquant dan pengoptimal PNG lainnya

    931+2Perubahan bintang dalam 7 hari terakhir
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant adalah teknik kuantisasi yang sederhana dan kuat untuk LLM.

    919+9Perubahan bintang dalam 7 hari terakhir
  • Daftar makalah terkait kuantisasi jaringan saraf dalam konferensi dan jurnal AI terbaru.

    851+6Perubahan bintang dalam 7 hari terakhir
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Toolkit canggih untuk mengompresi model besar termasuk LLM, VLM, dan model generatif video.

    747+4Perubahan bintang dalam 7 hari terakhir
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: Kuantisasi Dense-and-Sparse

    724+1Perubahan bintang dalam 7 hari terakhir
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo mencakup model pra-latihan serta lingkungan pembuatan dan evaluasi lengkap

    704+3Perubahan bintang dalam 7 hari terakhir
  • SINQ@huawei-csl

    Selamat datang di repositori resmi SINQ! Metode kuantisasi baru, cepat, dan berkualitas tinggi yang dirancang untuk membuat Large Language Model apa pun menjadi lebih kecil dengan tetap menjaga akurasi [ICML 2026]

    630+1Perubahan bintang dalam 7 hari terakhir
  • hipfire@warpfront

    Mesin inferensi LLM asli RDNA dalam Rust.

    608+45Perubahan bintang dalam 7 hari terakhir
  • tidy@slavabarkov

    Pencarian Text-to-Image dan Image-to-Image semantik luring di Android, didukung oleh model CLIP vision-language terkuantisasi yang canggih dan mesin inferensi ONNX Runtime.

    599+2Perubahan bintang dalam 7 hari terakhir
  • qkeras@google

    QKeras: pustaka deep learning kuantisasi untuk Tensorflow Keras

    584+0Perubahan bintang dalam 7 hari terakhir
  • onnx2tflite@MPolaris

    Alat untuk onnx->keras atau onnx->tflite. Semoga alat ini dapat membantu Anda.

    579+0Perubahan bintang dalam 7 hari terakhir
  • tessera@zengxiao-he

    Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.

    566+30Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik