跳到主要內容
buildradar
Sign in
主題 · quantization

quantization

標記 quantization 主題、收錄中的開源專案,依星數排序。

共 62 個專案
  • rwkv.cpp@RWKV

    適用於 RWKV 語言模型在 CPU 上進行 INT4/INT5/INT8 與 FP16 推理

    1,579+0近 7 天星數變化
  • model-optimization@tensorflow

    用於最佳化 Keras 與 TensorFlow 部署模型的工具包,包含量化與剪枝。

    1,578+0近 7 天星數變化
  • brevitas@Xilinx

    Brevitas:PyTorch 中的神經網路量化

    1,568+1近 7 天星數變化
  • gpu_poor@RahulSChand

    計算任何 LLM 所需的 token/s 與 GPU 記憶體需求。支援 llama.cpp/ggml/bnb/QLoRA 量化

    1,406+0近 7 天星數變化
  • geti@open-edge-platform

    以極少的時間與更少的数据建立電腦視覺模型。

    1,325+5近 7 天星數變化
  • Efficient-Computing@huawei-noah

    由 Huawei Noah's Ark Lab 開發的高效運算方法

    1,307+0近 7 天星數變化
  • GPTQModel@ModelCloud

    支援硬體加速的 LLM 模型量化(壓縮)工具包,可透過 HF、vLLM 及 SGLang 為 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 提供加速支援。

    1,248+0近 7 天星數變化
  • nncf@openvinotoolkit

    用於增強 OpenVINO™ 推理的神經網路壓縮框架

    1,197+4近 7 天星數變化
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,171+285近 7 天星數變化
  • marlin@IST-DASLab

    FP16xINT4 LLM 推論核心,在 16-32 個 token 的中等批次大小下,可實現近乎理想的約 4 倍加速。

    1,138+2近 7 天星數變化
  • z80ai@HarryR

    Z80-μLM 是一個 2 位元量化語言模型,小到足以在 8 位元 Z80 處理器上執行。使用 Python 訓練對話模型,將其匯出為 CP/M .COM 二進位檔,並與您的復古電腦對話。

    1,119+2近 7 天星數變化
  • optimum-quanto@huggingface

    一個用於 optimum 的 pytorch 量化後端

    1,053-1近 7 天星數變化
  • finn@Xilinx

    用於 FPGA 上 QNN 推論的資料流編譯器

    1,049+4近 7 天星數變化
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention:一種無需訓練的稀疏注意力機制,可加速任何模型的推論。

    1,043+1近 7 天星數變化
  • onnx2tf@PINTO0309

    用於將 ONNX 檔案轉換為 LiteRT/TFLite/TensorFlow、PyTorch 原生程式碼 (nn.Module)、TorchScript (.pt)、state_dict (.pt)、Exported Program (.pt2) 以及 Dynamo ONNX 的工具。它也支援從 LiteRT 直接轉換為 PyTorch。

    992+2近 7 天星數變化
  • TinyChatEngine@mit-han-lab

    TinyChatEngine:裝置端 LLM 推論庫

    961+0近 7 天星數變化
  • hqq@dropbox

    Half-Quadratic Quantization (HQQ) 的官方實作

    958+3近 7 天星數變化
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: IoT 裝置上的微型深度學習;[NeurIPS 2021] MCUNetV2: 適用於微型深度學習的記憶體高效率修補程式推論;[NeurIPS 2022] MCUNetV3: 256KB 記憶體限制下的裝置上訓練

    957+3近 7 天星數變化
  • libimagequant@ImageOptim

    驅動 pngquant 與其他 PNG 優化工具的調色盤量化函式庫

    930+1近 7 天星數變化
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant 是一個簡單且強大的 LLM 量化技術。

    918+8近 7 天星數變化
  • 近期 AI 會議與期刊中關於類神經網路量化的論文清單。

    851+6近 7 天星數變化
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] 一個強大的大型模型壓縮工具包,包含 LLM、VLM 及影片生成模型。

    747+4近 7 天星數變化
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM:稠密與稀疏量化

    724+1近 7 天星數變化
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo 包含預訓練模型以及完整的建置與評估環境

    703+2近 7 天星數變化
  • SINQ@huawei-csl

    歡迎來到 SINQ 的官方儲存庫!這是一種新穎、快速且高品質的量化方法,旨在縮小任何 Large Language Model 的體積同時保持準確度 [ICML 2026]

    630+1近 7 天星數變化
  • hipfire@warpfront

    使用 Rust 編寫的 RDNA 原生 LLM 推論引擎

    608+42近 7 天星數變化
  • tidy@slavabarkov

    Android 離線語意文字轉影像與影像轉影像搜尋,由量化後的頂尖視覺語言預訓練 CLIP 模型與 ONNX Runtime 推論引擎驅動

    599+1近 7 天星數變化
  • qkeras@google

    QKeras:用於 Tensorflow Keras 的量化深度學習函式庫。

    584+0近 7 天星數變化
  • onnx2tflite@MPolaris

    用於 onnx 轉 keras 或 onnx 轉 tflite 的工具。希望能對你有所幫助。

    579+0近 7 天星數變化
  • tessera@zengxiao-he

    從教師模型到模型切片——從零開始的 LLM 蒸餾與服務引擎:包含自訂 Triton/CUDA 核心、FSDP 蒸餾、paged-KV 連續批次處理、推測解碼、Rust 閘道、JAX 預測器與可解釋性工具。

    566+30近 7 天星數變化
← 返回主題列表