メインコンテンツへスキップ
buildradar
Sign in
トピック · quantization

quantization

quantization がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

62 件のリポジトリ
  • rwkv.cpp@RWKV

    RWKV 言語モデルの CPU 上での INT4/INT5/INT8 および FP16 推論。

    1,579+0直近 7 日のスター増減
  • model-optimization@tensorflow

    量子化やプルーニングを含む、KerasおよびTensorFlow向けのMLモデルデプロイ最適化ツールキット

    1,578+0直近 7 日のスター増減
  • brevitas@Xilinx

    Brevitas: PyTorch におけるニューラルネットワークの量子化

    1,568+1直近 7 日のスター増減
  • gpu_poor@RahulSChand

    あらゆる LLM のトークン/秒および GPU メモリ要件を計算します。llama.cpp/ggml/bnb/QLoRA の量子化をサポート

    1,406+0直近 7 日のスター増減
  • geti@open-edge-platform

    わずかな時間と少ないデータでコンピュータービジョンモデルを構築します。

    1,325+5直近 7 日のスター増減
  • Efficient-Computing@huawei-noah

    Huawei Noah's Ark Labが開発した効率的な計算手法。

    1,307+0直近 7 日のスター増減
  • GPTQModel@ModelCloud

    HF、vLLM、SGLang を介して Nvidia、AMD、Intel GPU および Intel/AMD/Apple CPU のハードウェアアクセラレーションをサポートする LLM モデル量子化 (圧縮) ツールキット。

    1,248+0直近 7 日のスター増減
  • nncf@openvinotoolkit

    OpenVINO™ の推論を最適化するためのニューラルネットワーク圧縮フレームワーク

    1,197+4直近 7 日のスター増減
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,185+285直近 7 日のスター増減
  • marlin@IST-DASLab

    16〜32トークンのミディアムバッチサイズで、ほぼ理想的な約4倍の高速化を実現できるFP16xINT4 LLM推論カーネル。

    1,138+2直近 7 日のスター増減
  • z80ai@HarryR

    Z80-μLMは、8ビットのZ80プロセッサで実行できるほど小型の2ビット量子化言語モデルです。Pythonで対話型モデルをトレーニングし、CP/M .COMバイナリとしてエクスポートして、ビンテージコンピューターとチャットできます。

    1,119+2直近 7 日のスター増減
  • optimum-quanto@huggingface

    optimum用のPyTorch量子化バックエンド。

    1,053-1直近 7 日のスター増減
  • finn@Xilinx

    FPGA上のQNN推論向けデータフローコンパイラ

    1,049+4直近 7 日のスター増減
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: あらゆるモデルの推論を加速する、トレーニング不要のスパースアテンション

    1,043+1直近 7 日のスター増減
  • onnx2tf@PINTO0309

    ONNXファイルをLiteRT/TFLite/TensorFlow、PyTorchネイティブコード(nn.Module)、TorchScript(.pt)、state_dict(.pt)、Exported Program(.pt2)、Dynamo ONNXに変換するツール。LiteRTからPyTorchへの直接変換もサポート

    992+2直近 7 日のスター増減
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: デバイス上LLM推論ライブラリ

    961+0直近 7 日のスター増減
  • hqq@dropbox

    Half-Quadratic Quantization (HQQ) の公式実装

    958+3直近 7 日のスター増減
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: IoT デバイス上の Tiny Deep Learning; [NeurIPS 2021] MCUNetV2: Tiny Deep Learning 向けのメモリ効率の高いパッチベース推論; [NeurIPS 2022] MCUNetV3: 256KB 未満のメモリでのオンデバイス学習

    957+3直近 7 日のスター増減
  • libimagequant@ImageOptim

    pngquant などの PNG 最適化ツールを支えるパレット量子化ライブラリ

    930+1直近 7 日のスター増減
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant は LLM 向けのシンプルかつ強力な量子化手法です。

    918+8直近 7 日のスター増減
  • 近年のAI関連の学会やジャーナルにおけるニューラルネットワークの量子化に関する論文リスト

    851+6直近 7 日のスター増減
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLM、VLM、動画生成モデルなどの大規模モデルを圧縮するための強力なツールキット

    747+4直近 7 日のスター増減
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: 密度・スパース量子化

    724+1直近 7 日のスター増減
  • hailo_model_zoo@hailo-ai

    事前トレーニング済みモデルと完全な構築・評価環境を含む Hailo Model Zoo

    704+2直近 7 日のスター増減
  • SINQ@huawei-csl

    SINQの公式リポジトリへようこそ!精度を維持しながらあらゆる大規模言語モデルを軽量化するために設計された、新規で高速かつ高品質な量子化手法 [ICML 2026]

    630+1直近 7 日のスター増減
  • hipfire@warpfront

    Rust 製の RDNA ネイティブ LLM 推論エンジン

    608+42直近 7 日のスター増減
  • tidy@slavabarkov

    量子化された最先端のビジョン言語事前学習済みCLIPモデルとONNX Runtime推論エンジンを搭載した、Android向けのオフラインセマンティックText-to-ImageおよびImage-to-Image検索

    599+1直近 7 日のスター増減
  • qkeras@google

    QKeras: Tensorflow Keras向けの量子化ディープラーニングライブラリ

    584+0直近 7 日のスター増減
  • onnx2tflite@MPolaris

    onnx から keras または tflite へ変換するツール。お役に立てれば幸いです。

    579+0直近 7 日のスター増減
  • tessera@zengxiao-he

    教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。

    566+30直近 7 日のスター増減
← トピック一覧に戻る