ztxz16/fastllm
@ztxz16fastllmはバックエンド依存のない高性能な大規模モデル推論ライブラリ。テンソル並列推論による密なモデルとハイブリッドモード推論によるMOEモデルをサポートし、任意の10G以上のGPUでフルスペックのDeepSeekを推論可能。2路の9004/9005サーバー+単一GPUでDeepSeekのフルスペック高精度オリジナルモデルをデプロイした場合、単一並列で20tps、INT4量子化モデルでは単一並列で30tps、マルチ並列では60+に達します。
スター
4,954
フォーク
485
言語
C++
ライセンス
Apache-2.0
最終プッシュ
1 週間前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。