quantization
Repositori open source terpantau bertanda quantization, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan quantization di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda quantization.
- #1
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 6.888 - #2
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 908 - #3
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 552
- #1
Fine-Tuning Efisien Terpadu untuk 100+ LLM & VLM (ACL 2024)
★ 74.443+158Perubahan bintang dalam 7 hari terakhir - #2
Transkripsi Faster Whisper dengan CTranslate2
★ 25.135+108Perubahan bintang dalam 7 hari terakhir - #3
Model bahasa besar LLaMA & Alpaca versi bahasa Mandarin + pelatihan dan deployment lokal menggunakan CPU/GPU.
★ 18.934+2Perubahan bintang dalam 7 hari terakhir - #4
[🔥memperbarui ...] Platform Riset Investasi Kuantitatif bertenaga AI (penerapan lokal sepenuhnya). 📃 dok online: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18.418+46Perubahan bintang dalam 7 hari terakhir - #5
Indeks vektor yang dibangun di atas TurboQuant, ditulis dalam Rust dengan binding Python.
★ 16.518+308Perubahan bintang dalam 7 hari terakhir - #6
Model bahasa besar yang dapat diakses melalui kuantisasi k-bit untuk PyTorch.
★ 8.446+16Perubahan bintang dalam 7 hari terakhir - #7
Kimi K3 dengan 2,78 triliun parameter yang menjalankan inferensi pada satu CPU dalam RAM 8,24 GB. C99 portabel: tanpa BLAS, tanpa framework, tanpa GPU.
★ 6.888+485Perubahan bintang dalam 7 hari terakhir - #8★ 5.744+4Perubahan bintang dalam 7 hari terakhir
- #9
Mesin inferensi cepat untuk model Transformer.
★ 4.651+23Perubahan bintang dalam 7 hari terakhir - #10
[ICLR2025 Spotlight] SVDQuant: Menyerap Outlier melalui Komponen Peringkat Rendah untuk Model Difusi 4-Bit.
★ 3.937+1Perubahan bintang dalam 7 hari terakhir - #11
Perpustakaan yang kompatibel dengan Transformers untuk menerapkan berbagai algoritma kompresi pada LLM guna optimalisasi penerapan dengan vLLM
★ 3.736+27Perubahan bintang dalam 7 hari terakhir - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention mencapai percepatan 2-5x dibandingkan dengan FlashAttention, tanpa kehilangan metrik end-to-end pada model bahasa, gambar, dan video.
★ 3.685+23Perubahan bintang dalam 7 hari terakhir - #13
🚀 Percepat inferensi dan pelatihan 🤗 Transformers, Diffusers, TIMM, dan Sentence Transformers dengan alat optimasi perangkat keras yang mudah digunakan
★ 3.473+9Perubahan bintang dalam 7 hari terakhir - #14
Model bahasa prat terlatih dan teknik optimasi terkait yang dikembangkan oleh Huawei Noah's Ark Lab.
★ 3.166+1Perubahan bintang dalam 7 hari terakhir - #15★ 2.959+7Perubahan bintang dalam 7 hari terakhir
- #16
Plugin ComfyUI untuk Nunchaku
★ 2.920+2Perubahan bintang dalam 7 hari terakhir - #17
Lembar contekan Anda untuk wawancara AI Engineering – Pertanyaan dan Jawaban.
★ 2.888+112Perubahan bintang dalam 7 hari terakhir - #18
Kuantisasi LLM low-bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; teknik kompresi model terdepan pada PyTorch, TensorFlow, dan ONNX Runtime
★ 2.706+5Perubahan bintang dalam 7 hari terakhir - #19
AIMET adalah pustaka yang menyediakan teknik kuantisasi dan kompresi canggih untuk model jaringan saraf yang telah dilatih.
★ 2.690+7Perubahan bintang dalam 7 hari terakhir - #20
Bangun, personalisasi, dan kendalikan LLM Anda sendiri. Dari pra-pemrosesan data hingga fine-tuning, xTuring menyediakan cara mudah untuk mempersonalisasi LLM sumber terbuka. Bergabunglah dengan komunitas discord kami: https://discord.gg/TgHXuSJEk6
★ 2.674+0Perubahan bintang dalam 7 hari terakhir - #21
Daftar makalah, dokumen, dan kode tentang kuantisasi model. Repositori ini bertujuan menyediakan informasi untuk penelitian kuantisasi model dan terus dikembangkan. Silakan ajukan PR untuk karya (makalah, repositori) yang belum tercantum.
★ 2.433+4Perubahan bintang dalam 7 hari terakhir - #22
Menguasai AI Terapan, satu konsep dalam satu waktu.
★ 2.377-1Perubahan bintang dalam 7 hari terakhir - #23
Jalankan model Mixtral-8x7B di Colab atau desktop konsumen
★ 2.333+1Perubahan bintang dalam 7 hari terakhir - #24
micronet, pustaka kompresi dan deployment model. Kompresi: 1. Kuantisasi: quantization-aware-training (QAT), High-Bit (>2b), Low-Bit (≤2b)/Ternary dan Binary (TWN/BNN/XNOR-Net); post-training-quantization (PTQ), 8-bit (tensorrt); 2. Pruning: normal, regular, dan group convolutional channel pruning; 3. grou
★ 2.266+0Perubahan bintang dalam 7 hari terakhir - #25★ 1.923+6Perubahan bintang dalam 7 hari terakhir
- #26
PPL Quantization Tool (PPQ) adalah alat kuantisasi jaringan saraf tiruan offline yang kuat.
★ 1.817+2Perubahan bintang dalam 7 hari terakhir - #27★ 1.682+0Perubahan bintang dalam 7 hari terakhir
- #28
PaddleSlim adalah pustaka sumber terbuka untuk kompresi model mendalam dan pencarian arsitektur.
★ 1.612+1Perubahan bintang dalam 7 hari terakhir - #29
Algoritma kuantisasi SOTA untuk inferensi LLM bit-rendah dengan akurasi tinggi, dioptimalkan secara mulus untuk CPU/XPU/CUDA, dengan dukungan berbagai tipe data dan kompatibilitas penuh dengan vLLM, SGLang, dan Transformers.
★ 1.594+15Perubahan bintang dalam 7 hari terakhir - #30★ 1.579-1Perubahan bintang dalam 7 hari terakhir