ztxz16 收錄中的開源專案,依星數排序。
fastllm 是後端無依賴的高性能大模型推理庫,同時支持張量並行推理稠密模型和混合模式推理 MOE 模型,任意 10G 以上顯卡即可推理滿血 DeepSeek。雙路 9004/9005 伺服器+單顯卡部署 DeepSeek 滿血滿精度原版模型,單並發 20tps;INT4 量化模型單並發 30tps,多並發可達 60+