quantization
quantization がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
quantization と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、quantization がタグ付けされたリポジトリ。
- #1
2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。
★ 6,905 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。
★ 552
- #1
100以上のLLMおよびVLMの統一的効率的なファインチューニング (ACL 2024)
★ 74,443+158直近 7 日のスター増減 - #2
CTranslate2による高速なWhisper文字起こし
★ 25,135+108直近 7 日のスター増減 - #3
中国語LLaMA & Alpaca大規模言語モデル + ローカルCPU/GPUでの学習・デプロイ (Chinese LLaMA & Alpaca LLMs)
★ 18,934+2直近 7 日のスター増減 - #4
[🔥更新中...] AI自動定量取引ロボット (完全ローカルデプロイ) AI搭載の定量的投資リサーチプラットフォーム。 📃 オンラインドキュメント: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18,418+46直近 7 日のスター増減 - #5★ 16,518+308直近 7 日のスター増減
- #6
PyTorch向けにk-bit量子化によるアクセシブルな大規模言語モデル。
★ 8,446+16直近 7 日のスター増減 - #7
2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。
★ 6,905+485直近 7 日のスター増減 - #8★ 5,744+4直近 7 日のスター増減
- #9
Transformerモデル向けの高速推論エンジン
★ 4,651+23直近 7 日のスター増減 - #10★ 3,937+1直近 7 日のスター増減
- #11
vLLMでの最適化されたデプロイメントのために、様々な圧縮アルゴリズムをLLMに適用するためのTransformers互換ライブラリ。
★ 3,736+27直近 7 日のスター増減 - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量子化アテンションにより、言語、画像、動画モデルのエンドツーエンドの指標を落とすことなく、FlashAttentionと比較して2〜5倍の高速化を実現
★ 3,685+23直近 7 日のスター増減 - #13
🚀 使いやすいハードウェア最適化ツールで 🤗 Transformers、Diffusers、TIMM、Sentence Transformersの推論とトレーニングを加速する
★ 3,473+9直近 7 日のスター増減 - #14
Huawei Noah's Ark Labが開発した事前学習済み言語モデルおよび関連する最適化技術。
★ 3,166+1直近 7 日のスター増減 - #15★ 2,959+7直近 7 日のスター増減
- #16
NunchakuのComfyUIプラグイン
★ 2,920+2直近 7 日のスター増減 - #17
AIエンジニアの面接対策チートシート – 質問と回答
★ 2,888+112直近 7 日のスター増減 - #18
SOTA 低ビット LLM 量子化 (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) とスパース性;PyTorch、TensorFlow、ONNX Runtime における主要なモデル圧縮技術
★ 2,706+5直近 7 日のスター増減 - #19★ 2,690+7直近 7 日のスター増減
- #20
独自の LLM の構築、パーソナライズ、制御。データの前処理からファインチューニングまで、xTuring はオープンソース LLM をパーソナライズする簡単な方法を提供します。Discord コミュニティに参加してください: https://discord.gg/TgHXuSJEk6
★ 2,674+0直近 7 日のスター増減 - #21
モデル量子化に関する論文、ドキュメント、コードのリスト。モデル量子化の研究に向けた情報提供を目的としており、継続的にプロジェクトを改善しています。見落としている作品(論文、リポジトリ)のPRを歓迎します。
★ 2,433+4直近 7 日のスター増減 - #22
応用 AI を一つずつマスターする
★ 2,377-1直近 7 日のスター増減 - #23
Google Colab や一般のデスクトップで Mixtral-8x7B モデルを実行する
★ 2,333+1直近 7 日のスター増減 - #24
モデルの圧縮およびデプロイライブラリ「micronet」。圧縮機能:1. 量子化(QAT、High-Bit、Low-Bit/Ternary and Binary、PTQ、8-bit);2. プルーニング(通常、正規、およびグループ畳み込みチャネルプルーニング);3. グループ
★ 2,266+0直近 7 日のスター増減 - #25★ 1,923+6直近 7 日のスター増減
- #26★ 1,817+2直近 7 日のスター増減
- #27★ 1,682+0直近 7 日のスター増減
- #28
PaddleSlim は、ディープモデルの圧縮とアーキテクチャ探索のためのオープンソースライブラリです。
★ 1,612+1直近 7 日のスター増減 - #29
高精度な低ビット LLM 推論のための SOTA 量子化アルゴリズム。CPU、XPU、CUDA にシームレスに最適化され、多様なデータ型をサポート。vLLM、SGLang、Transformers と完全に互換性があります。
★ 1,594+15直近 7 日のスター増減 - #30★ 1,579-1直近 7 日のスター増減