メインコンテンツへスキップ
buildradar
ログイン

ztxz16/fastllm

@ztxz16

fastllmはバックエンド依存のない高性能な大規模モデル推論ライブラリ。テンソル並列推論による密なモデルとハイブリッドモード推論によるMOEモデルをサポートし、任意の10G以上のGPUでフルスペックのDeepSeekを推論可能。2路の9004/9005サーバー+単一GPUでDeepSeekのフルスペック高精度オリジナルモデルをデプロイした場合、単一並列で20tps、INT4量子化モデルでは単一並列で30tps、マルチ並列では60+に達します。

スター
4,954
フォーク
485
言語
C++
ライセンス
Apache-2.0
最終プッシュ
1 週間前
C++

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。