ztxz16/fastllm
@ztxz16fastllm은 백엔드 의존성이 없는 고성능 대규모 언어 모델 추론 라이브러리입니다. 텐서 병렬 추론을 통한 촘촘한(dense) 모델과 MoE 모델의 혼합 모드 추론을 동시에 지원하며, 10G 이상의 그래픽카드만 있으면 온전한 성능의 DeepSeek 추론이 가능합니다. 듀얼 9004/9005 서버 + 단일 그래픽카드 환경에서 온전한 성능 및 정밀도의 오리지널 DeepSeek 모델 배포 시 단일 동시성 20tps, INT4 양자화 모델은 단일 동시성 30tps, 다중 동시성은 60+ tps에 달합니다.
스타
4,954
포크
485
언어
C++
라이선스
Apache-2.0
마지막 푸시
1주 전
관련 인텔 (0)
아직 관련 인텔이 없습니다
이 저장소는 radar가 추적하는 어떤 소스에도 아직 등장하지 않았습니다. 수집기는 예약에 따라 실행됩니다——이 저장소를 다루게 되면 다시 확인하세요.