본문으로 건너뛰기
buildradar
Sign in

NVIDIA/Model-Optimizer

@NVIDIA

양자화, 증류, 가지치기(pruning), 신경 아키텍처 검색, 추측 디코딩 등 SOTA 모델 최적화 기술을 통합한 라이브러리입니다. TensorRT-LLM, TensorRT, vLLM 등의 다운스트림 배포 프레임워크를 위해 딥러닝 모델을 압축하여 추론 속도를 최적화합니다.

스타
3,697
포크
578
언어
Python
라이선스
Apache-2.0
마지막 푸시
5일 전
Python

아직 관련 인텔이 없습니다

이 저장소는 radar가 추적하는 어떤 소스에도 아직 등장하지 않았습니다. 수집기는 예약에 따라 실행됩니다——이 저장소를 다루게 되면 다시 확인하세요.