NVIDIA/Model-Optimizer
@NVIDIA量子化、蒸留、プルーニング、ニューラルアーキテクチャ探索、予測的デコードなどのSOTAモデル最適化技術の統合ライブラリ。TensorRT-LLM、TensorRT、vLLMなどの下流デプロイメントフレームワーク向けにディープラーニングモデルを圧縮し、推論速度を最適化する。
スター
3,697
フォーク
578
言語
Python
ライセンス
Apache-2.0
最終プッシュ
5 日前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。