microsoft/MInference
@microsoftロングコンテキスト LLM の推論を高速化するため、近似および動的スパース計算によりアテンション処理を行い、A100 でのプリフィル時の推論遅延を精度を維持したまま最大 10 倍削減します。
スター
1,226
フォーク
80
言語
Python
ライセンス
MIT
最終プッシュ
5 か月前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。