跳到主要内容
buildradar
Sign in
主题 · quantization

quantization

标记 quantization 主题、收录中的开源项目,按星标数排序。

共 62 个项目
  • rwkv.cpp@RWKV

    适用于 RWKV 语言模型在 CPU 上进行 INT4/INT5/INT8 与 FP16 推理

    1,579+0近 7 天星标变化
  • model-optimization@tensorflow

    用于优化 Keras 与 TensorFlow 部署模型的工具包,包含量化与剪枝。

    1,578+0近 7 天星标变化
  • brevitas@Xilinx

    Brevitas:PyTorch 中的神经网络量化

    1,568+1近 7 天星标变化
  • gpu_poor@RahulSChand

    计算任何 LLM 所需的 token/s 与 GPU 内存需求。支持 llama.cpp/ggml/bnb/QLoRA 量化

    1,406+0近 7 天星标变化
  • geti@open-edge-platform

    以极少的时间与更少的数据建立计算机视觉模型。

    1,325+5近 7 天星标变化
  • Efficient-Computing@huawei-noah

    由 Huawei Noah's Ark Lab 开发的高效计算方法

    1,307+0近 7 天星标变化
  • GPTQModel@ModelCloud

    支持硬件加速的 LLM 模型量化(压缩)工具包,可通过 HF、vLLM 及 SGLang 为 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 提供加速支持。

    1,248+0近 7 天星标变化
  • nncf@openvinotoolkit

    用于增强 OpenVINO™ 推理的神经网络压缩框架

    1,197+4近 7 天星标变化
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,185+285近 7 天星标变化
  • marlin@IST-DASLab

    FP16xINT4 LLM 推理核心,在 16-32 个 token 的中等批次大小下,可实现近乎理想的约 4 倍加速。

    1,138+2近 7 天星标变化
  • z80ai@HarryR

    Z80-μLM 是一个 2 比特量化语言模型,小到足以在 8 比特 Z80 处理器上运行。使用 Python 训练对话模型,将其导出为 CP/M .COM 二进制文件,并与您的复古电脑对话。

    1,119+2近 7 天星标变化
  • optimum-quanto@huggingface

    一个用于 optimum 的 pytorch 量化后端

    1,053-1近 7 天星标变化
  • finn@Xilinx

    用于 FPGA 上 QNN 推理的数据流编译器

    1,053+4近 7 天星标变化
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention:一种无需训练的稀疏注意力机制,可加速任何模型的推理。

    1,045+1近 7 天星标变化
  • onnx2tf@PINTO0309

    用于将 ONNX 文件转换为 LiteRT/TFLite/TensorFlow、PyTorch 原生代码 (nn.Module)、TorchScript (.pt)、state_dict (.pt)、Exported Program (.pt2) 以及 Dynamo ONNX 的工具。它还支持从 LiteRT 直接转换为 PyTorch。

    993+2近 7 天星标变化
  • TinyChatEngine@mit-han-lab

    TinyChatEngine:设备端 LLM 推理库

    961+0近 7 天星标变化
  • hqq@dropbox

    Half-Quadratic Quantization (HQQ) 的官方实现

    958+3近 7 天星标变化
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet:IoT 设备上的微型深度学习;[NeurIPS 2021] MCUNetV2:适用于微型深度学习的内存高效率补丁式推理;[NeurIPS 2022] MCUNetV3:256KB 内存限制下的设备端训练

    957+3近 7 天星标变化
  • libimagequant@ImageOptim

    驱动 pngquant 与其他 PNG 优化工具的调色盘量化函数库

    931+1近 7 天星标变化
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant 是一个简单且强大的 LLM 量化技术。

    919+8近 7 天星标变化
  • 近期 AI 会议与期刊中关于神经网络量化的论文清单。

    851+6近 7 天星标变化
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] 一个强大的大型模型压缩工具包,包含 LLM、VLM 及视频生成模型。

    747+4近 7 天星标变化
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM:稠密与稀疏量化

    724+1近 7 天星标变化
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo 包含预训练模型以及完整的构建与评估环境

    704+2近 7 天星标变化
  • SINQ@huawei-csl

    欢迎来到 SINQ 的官方仓库!这是一种新颖、快速且高质量的量化方法,旨在缩小任何 Large Language Model 的体积同时保持准确度 [ICML 2026]

    630+1近 7 天星标变化
  • hipfire@warpfront

    使用 Rust 编写的 RDNA 原生 LLM 推理引擎

    608+42近 7 天星标变化
  • tidy@slavabarkov

    Android 离线语义文字转影像与影像转影像搜索,由量化后的顶尖视觉语言预训练 CLIP 模型与 ONNX Runtime 推理引擎驱动

    599+1近 7 天星标变化
  • qkeras@google

    QKeras:用于 Tensorflow Keras 的量化深度学习库。

    584+0近 7 天星标变化
  • onnx2tflite@MPolaris

    用于 onnx 转 keras 或 onnx 转 tflite 的工具。希望能对你有所帮助。

    579+0近 7 天星标变化
  • tessera@zengxiao-he

    从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。

    566+30近 7 天星标变化
← 返回主题列表