quantization
标记 quantization 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 quantization 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 quantization 主题的项目。
- #1
Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU
★ 7,179 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,191
- #1
统一高效微调 100 多种 LLM 与 VLM(ACL 2024)
★ 74,532+89近 7 天星标变化 - #2
使用 CTranslate2 的 Faster Whisper 转录
★ 25,206+71近 7 天星标变化 - #3
中文 LLaMA 与 Alpaca 大语言模型 + 本地 CPU/GPU 训练部署
★ 18,934+0近 7 天星标变化 - #4
[🔥updating ...] AI 自动量化交易机器人(完全本地部署)AI 驱动的量化投资研究平台。📃 在线文档:https://ufund-me.github.io/Qbot ✨ :news: qbot-mini:https://github.com/Charmve/iQuant
★ 18,439+21近 7 天星标变化 - #5★ 16,650+132近 7 天星标变化
- #6
通过 k 位量化在 PyTorch 中访问大型语言模型
★ 8,452+6近 7 天星标变化 - #7
Kimi K3 2.78 兆参数模型,单 CPU 推理 8.24 GB RAM,C99 可携式:无 BLAS、无框架、无 GPU
★ 7,179+442近 7 天星标变化 - #8★ 5,746+2近 7 天星标变化
- #9
Transformer 模型的快速推理引擎
★ 4,658+7近 7 天星标变化 - #10★ 3,941+4近 7 天星标变化
- #11
与 Transformers 兼容的库,可对 LLM 应用各种压缩算法,以 vLLM 优化部署
★ 3,753+17近 7 天星标变化 - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention 在速度上比 FlashAttention 提升 2-5 倍,且不损失语言、影像与影片模型的端到端指标
★ 3,699+14近 7 天星标变化 - #13★ 3,477+4近 7 天星标变化
- #14
由华为 Noah's Ark Lab 开发的预训练语言模型及其相关优化技术
★ 3,166+0近 7 天星标变化 - #15
AI 工程面试备忘录 – 问题与解答。
★ 2,962+74近 7 天星标变化 - #16★ 2,961+2近 7 天星标变化
- #17
ComfyUI 的 Nunchaku 插件
★ 2,919-1近 7 天星标变化 - #18
领先的低比特大型语言模型(LLM)量化(INT8/FP8/MXFP8/INT4/MXFP4/NVFP4)与稀疏化技术;基于 PyTorch、TensorFlow 和 ONNX Runtime 的顶尖模型压缩技术
★ 2,706+0近 7 天星标变化 - #19★ 2,700+10近 7 天星标变化
- #20
构建、个性化并控制您自己的 LLM。从数据预处理到微调,xTuring 提供了一种简单的方法来个性化开源 LLM。加入我们的 discord 社区:https://discord.gg/TgHXuSJEk6
★ 2,674+0近 7 天星标变化 - #21
关于模型量化的论文、文档与代码清单。此仓库旨在提供模型量化研究的信息,我们正持续改进该项目。欢迎通过 PR 补充本仓库遗漏的相关著作(论文、仓库)。
★ 2,433+0近 7 天星标变化 - #22
掌握应用 AI,一次掌握一个概念
★ 2,378+1近 7 天星标变化 - #23
在 Colab 或消费级桌面上运行 Mixtral-8x7B 模型
★ 2,334+1近 7 天星标变化 - #24
micronet 是一个模型压缩与部署库。压缩:1、量化:量化感知训练 (QAT)、高比特 (>2b)、低比特 (≤2b)/三元与二元;后训练量化 (PTQ)、8 比特 (tensorrt);2、剪枝:正常、规则与群组卷积通道剪枝;3、群组
★ 2,265-1近 7 天星标变化 - #25★ 1,927+4近 7 天星标变化
- #26★ 1,820+3近 7 天星标变化
- #27★ 1,683+1近 7 天星标变化
- #28★ 1,619+58近 7 天星标变化
- #29
PaddleSlim 是一个用于深度模型压缩与架构搜索的开源库。
★ 1,613+1近 7 天星标变化 - #30
用于高精度低比特 LLM 推理的 SOTA 量化算法,针对 CPU/XPU/CUDA 进行无缝优化,支持多种数据类型,并与 vLLM、SGLang 和 Transformers 完全兼容。
★ 1,599+8近 7 天星标变化