メインコンテンツへスキップ
buildradar
Sign in

microsoft/MInference

@microsoft

ロングコンテキスト LLM の推論を高速化するため、近似および動的スパース計算によりアテンション処理を行い、A100 でのプリフィル時の推論遅延を精度を維持したまま最大 10 倍削減します。

スター
1,226
フォーク
80
言語
Python
ライセンス
MIT
最終プッシュ
5 か月前
Python

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。