跳到主要內容
buildradar
登入

ztxz16/fastllm

@ztxz16

fastllm 是後端無依賴的高性能大模型推理庫,同時支持張量並行推理稠密模型和混合模式推理 MOE 模型,任意 10G 以上顯卡即可推理滿血 DeepSeek。雙路 9004/9005 伺服器+單顯卡部署 DeepSeek 滿血滿精度原版模型,單並發 20tps;INT4 量化模型單並發 30tps,多並發可達 60+

星數
4,954
Fork 數
485
語言
C++
授權
Apache-2.0
最後推送
1 週前
C++

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。