ztxz16 の追跡中のオープンソースリポジトリを、スター数順に表示します。
fastllmはバックエンド依存のない高性能な大規模モデル推論ライブラリ。テンソル並列推論による密なモデルとハイブリッドモード推論によるMOEモデルをサポートし、任意の10G以上のGPUでフルスペックのDeepSeekを推論可能。2路の9004/9005サーバー+単一GPUでDeepSeekのフルスペック高精度オリジナルモデルをデプロイした場合、単一並列で20tps、INT4量子化モデルでは単一並列で30tps、マルチ並列では60+に達します。