quantization
Repositori open source terpantau bertanda quantization, diurutkan berdasarkan bintang.
- #31★ 1.579+0Perubahan bintang dalam 7 hari terakhir
- #32
Toolkit untuk mengoptimalkan model ML untuk penerapan pada Keras dan TensorFlow, termasuk kuantisasi dan pruning.
★ 1.578+0Perubahan bintang dalam 7 hari terakhir - #33★ 1.568+1Perubahan bintang dalam 7 hari terakhir
- #34
Menghitung token/s & kebutuhan memori GPU untuk LLM apa pun. Mendukung kuantisasi llama.cpp/ggml/bnb/QLoRA
★ 1.406+0Perubahan bintang dalam 7 hari terakhir - #35
Bangun model computer vision dalam waktu yang jauh lebih singkat dan dengan lebih sedikit data.
★ 1.325+5Perubahan bintang dalam 7 hari terakhir - #36
Metode komputasi efisien yang dikembangkan oleh Huawei Noah's Ark Lab
★ 1.307+0Perubahan bintang dalam 7 hari terakhir - #37
Toolkit kuantisasi (kompresi) model LLM dengan dukungan akselerasi HW untuk GPU Nvidia, AMD, Intel, dan CPU Intel/AMD/Apple melalui HF, vLLM, dan SGLang.
★ 1.248+0Perubahan bintang dalam 7 hari terakhir - #38
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.200+316Perubahan bintang dalam 7 hari terakhir - #39
Kerangka Kerja Kompresi Jaringan Syaraf untuk inferensi OpenVINO™ yang ditingkatkan
★ 1.197+4Perubahan bintang dalam 7 hari terakhir - #40
Kernel inferensi LLM FP16xINT4 yang dapat mencapai percepatan ~4x yang mendekati ideal hingga ukuran batch sedang 16-32 token.
★ 1.138+2Perubahan bintang dalam 7 hari terakhir - #41
Z80-μLM adalah model bahasa terkuantisasi 2-bit yang cukup kecil untuk dijalankan pada prosesor Z80 8-bit. Latih model percakapan dengan Python, ekspor sebagai biner .COM CP/M, dan mengobrollah dengan komputer klasik Anda.
★ 1.119+2Perubahan bintang dalam 7 hari terakhir - #42★ 1.053+8Perubahan bintang dalam 7 hari terakhir
- #43
Backend kuantisasi pytorch untuk optimum
★ 1.053-1Perubahan bintang dalam 7 hari terakhir - #44
[ICML2025] SpargeAttention: Perhatian jarang tanpa pelatihan yang mempercepat inferensi model apa pun.
★ 1.045+3Perubahan bintang dalam 7 hari terakhir - #45
Alat untuk mengonversi file ONNX ke LiteRT/TFLite/TensorFlow, kode natif PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2), dan Dynamo ONNX. Alat ini juga mendukung konversi langsung dari LiteRT ke PyTorch.
★ 993+3Perubahan bintang dalam 7 hari terakhir - #46
TinyChatEngine: Pustaka Inferensi LLM Pada Perangkat
★ 961+0Perubahan bintang dalam 7 hari terakhir - #47★ 958+3Perubahan bintang dalam 7 hari terakhir
- #48
[NeurIPS 2020] MCUNet: Deep Learning Kecil pada Perangkat IoT; [NeurIPS 2021] MCUNetV2: Inferensi Berbasis Patch yang Efisien Memori untuk Deep Learning Kecil; [NeurIPS 2022] MCUNetV3: Pelatihan di Perangkat di Bawah Memori 256KB
★ 957+3Perubahan bintang dalam 7 hari terakhir - #49
Pustaka kuantisasi palet yang mendukung pngquant dan pengoptimal PNG lainnya
★ 931+2Perubahan bintang dalam 7 hari terakhir - #50
[ICLR2024 spotlight] OmniQuant adalah teknik kuantisasi yang sederhana dan kuat untuk LLM.
★ 919+9Perubahan bintang dalam 7 hari terakhir - #51
Daftar makalah terkait kuantisasi jaringan saraf dalam konferensi dan jurnal AI terbaru.
★ 851+6Perubahan bintang dalam 7 hari terakhir - #52
[EMNLP 2024 & AAAI 2026] Toolkit canggih untuk mengompresi model besar termasuk LLM, VLM, dan model generatif video.
★ 747+4Perubahan bintang dalam 7 hari terakhir - #53
[ICML 2024] SqueezeLLM: Kuantisasi Dense-and-Sparse
★ 724+1Perubahan bintang dalam 7 hari terakhir - #54
Hailo Model Zoo mencakup model pra-latihan serta lingkungan pembuatan dan evaluasi lengkap
★ 704+3Perubahan bintang dalam 7 hari terakhir - #55
Selamat datang di repositori resmi SINQ! Metode kuantisasi baru, cepat, dan berkualitas tinggi yang dirancang untuk membuat Large Language Model apa pun menjadi lebih kecil dengan tetap menjaga akurasi [ICML 2026]
★ 630+1Perubahan bintang dalam 7 hari terakhir - #56★ 608+45Perubahan bintang dalam 7 hari terakhir
- #57
Pencarian Text-to-Image dan Image-to-Image semantik luring di Android, didukung oleh model CLIP vision-language terkuantisasi yang canggih dan mesin inferensi ONNX Runtime.
★ 599+2Perubahan bintang dalam 7 hari terakhir - #58★ 584+0Perubahan bintang dalam 7 hari terakhir
- #59
Alat untuk onnx->keras atau onnx->tflite. Semoga alat ini dapat membantu Anda.
★ 579+0Perubahan bintang dalam 7 hari terakhir - #60
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 566+30Perubahan bintang dalam 7 hari terakhir