quantization
quantization がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31★ 1,579+0直近 7 日のスター増減
- #32
量子化やプルーニングを含む、KerasおよびTensorFlow向けのMLモデルデプロイ最適化ツールキット
★ 1,578+0直近 7 日のスター増減 - #33★ 1,568+1直近 7 日のスター増減
- #34★ 1,406+0直近 7 日のスター増減
- #35★ 1,325+5直近 7 日のスター増減
- #36
Huawei Noah's Ark Labが開発した効率的な計算手法。
★ 1,307+0直近 7 日のスター増減 - #37
HF、vLLM、SGLang を介して Nvidia、AMD、Intel GPU および Intel/AMD/Apple CPU のハードウェアアクセラレーションをサポートする LLM モデル量子化 (圧縮) ツールキット。
★ 1,248+0直近 7 日のスター増減 - #38★ 1,197+4直近 7 日のスター増減
- #39
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,185+285直近 7 日のスター増減 - #40★ 1,138+2直近 7 日のスター増減
- #41
Z80-μLMは、8ビットのZ80プロセッサで実行できるほど小型の2ビット量子化言語モデルです。Pythonで対話型モデルをトレーニングし、CP/M .COMバイナリとしてエクスポートして、ビンテージコンピューターとチャットできます。
★ 1,119+2直近 7 日のスター増減 - #42
optimum用のPyTorch量子化バックエンド。
★ 1,053-1直近 7 日のスター増減 - #43★ 1,049+4直近 7 日のスター増減
- #44
[ICML2025] SpargeAttention: あらゆるモデルの推論を加速する、トレーニング不要のスパースアテンション
★ 1,043+1直近 7 日のスター増減 - #45
ONNXファイルをLiteRT/TFLite/TensorFlow、PyTorchネイティブコード(nn.Module)、TorchScript(.pt)、state_dict(.pt)、Exported Program(.pt2)、Dynamo ONNXに変換するツール。LiteRTからPyTorchへの直接変換もサポート
★ 992+2直近 7 日のスター増減 - #46
TinyChatEngine: デバイス上LLM推論ライブラリ
★ 961+0直近 7 日のスター増減 - #47★ 958+3直近 7 日のスター増減
- #48
[NeurIPS 2020] MCUNet: IoT デバイス上の Tiny Deep Learning; [NeurIPS 2021] MCUNetV2: Tiny Deep Learning 向けのメモリ効率の高いパッチベース推論; [NeurIPS 2022] MCUNetV3: 256KB 未満のメモリでのオンデバイス学習
★ 957+3直近 7 日のスター増減 - #49
pngquant などの PNG 最適化ツールを支えるパレット量子化ライブラリ
★ 930+1直近 7 日のスター増減 - #50★ 918+8直近 7 日のスター増減
- #51
近年のAI関連の学会やジャーナルにおけるニューラルネットワークの量子化に関する論文リスト
★ 851+6直近 7 日のスター増減 - #52
[EMNLP 2024 & AAAI 2026] LLM、VLM、動画生成モデルなどの大規模モデルを圧縮するための強力なツールキット
★ 747+4直近 7 日のスター増減 - #53
[ICML 2024] SqueezeLLM: 密度・スパース量子化
★ 724+1直近 7 日のスター増減 - #54
事前トレーニング済みモデルと完全な構築・評価環境を含む Hailo Model Zoo
★ 704+2直近 7 日のスター増減 - #55★ 630+1直近 7 日のスター増減
- #56★ 608+42直近 7 日のスター増減
- #57
量子化された最先端のビジョン言語事前学習済みCLIPモデルとONNX Runtime推論エンジンを搭載した、Android向けのオフラインセマンティックText-to-ImageおよびImage-to-Image検索
★ 599+1直近 7 日のスター増減 - #58★ 584+0直近 7 日のスター増減
- #59
onnx から keras または tflite へ変換するツール。お役に立てれば幸いです。
★ 579+0直近 7 日のスター増減 - #60
教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。
★ 566+30直近 7 日のスター増減