ztxz16/fastllm
@ztxz16fastllm là thư viện suy luận mô hình ngôn ngữ lớn hiệu suất cao, không phụ thuộc backend. Hỗ trợ đồng thời suy luận song song tensor cho mô hình dày đặc (dense) và suy luận chế độ hỗn hợp cho mô hình MoE, bất kỳ GPU nào từ 10G trở lên đều có thể chạy suy luận DeepSeek nguyên bản đầy đủ. Triển khai mô hình nguyên bản độ chính xác đầy đủ DeepSeek trên máy chủ Dual 9004/9005 + GPU đơn đạt 20 tps cho một luồng đồng thời; mô hình lượng tử hóa INT4 đạt 30 tps cho một luồng đồng thời, và nhiều luồng có thể đạt 60+
Sao
4.954
Fork
485
Ngôn ngữ
C++
Giấy phép
Apache-2.0
Push gần nhất
1 tuần trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.