quantization
quantization 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31★ 1,579+0최근 7일 스타 변화
- #32
양자화 및 가지치기(pruning)를 포함하여 배포를 위해 Keras 및 TensorFlow의 ML 모델을 최적화하는 툴킷
★ 1,578+0최근 7일 스타 변화 - #33★ 1,568+1최근 7일 스타 변화
- #34★ 1,406+1최근 7일 스타 변화
- #35★ 1,325+7최근 7일 스타 변화
- #36
화웨이 노아스 아크 연구소(Huawei Noah's Ark Lab)에서 개발한 고효율 연산 방법
★ 1,307+0최근 7일 스타 변화 - #37
HF, vLLM, SGLang을 통해 Nvidia, AMD, Intel GPU 및 Intel/AMD/Apple CPU의 하드웨어 가속을 지원하는 LLM 모델 양자화(압축) 툴킷.
★ 1,248+2최근 7일 스타 변화 - #38★ 1,197+4최근 7일 스타 변화
- #39
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,158+317최근 7일 스타 변화 - #40★ 1,138+2최근 7일 스타 변화
- #41
Z80-μLM은 8비트 Z80 프로세서에서 실행될 만큼 작은 2비트 양자화 언어 모델입니다. Python으로 대화형 모델을 학습시키고 CP/M .COM 바이너리로 내보내 빈티지 컴퓨터와 대화할 수 있습니다.
★ 1,119+1최근 7일 스타 변화 - #42
optimum을 위한 PyTorch 양자화 백엔드
★ 1,053+1최근 7일 스타 변화 - #43★ 1,049+2최근 7일 스타 변화
- #44
[ICML2025] SpargeAttention: 모든 모델의 추론을 가속화하는 학습 없는 희소 어텐션(sparse attention).
★ 1,043+10최근 7일 스타 변화 - #45
ONNX 파일을 LiteRT/TFLite/TensorFlow, PyTorch 네이티브 코드(nn.Module), TorchScript(.pt), state_dict(.pt), Exported Program(.pt2), Dynamo ONNX로 변환하는 도구입니다. LiteRT에서 PyTorch로의 직접 변환도 지원합니다.
★ 992+3최근 7일 스타 변화 - #46
TinyChatEngine: 온디바이스 LLM 추론 라이브러리
★ 961+0최근 7일 스타 변화 - #47★ 958+1최근 7일 스타 변화
- #48
[NeurIPS 2020] MCUNet: IoT 기기를 위한 소형 딥러닝; [NeurIPS 2021] MCUNetV2: 소형 딥러닝을 위한 메모리 효율적인 패치 기반 추론; [NeurIPS 2022] MCUNetV3: 256KB 메모리 하에서의 온디바이스 학습
★ 957+1최근 7일 스타 변화 - #49
pngquant 및 기타 PNG 최적화 도구를 지원하는 팔레트 양자화 라이브러리
★ 930+2최근 7일 스타 변화 - #50★ 918+5최근 7일 스타 변화
- #51
최근 AI 학회 및 저널의 신경망 양자화 관련 논문 목록입니다.
★ 851+5최근 7일 스타 변화 - #52
[EMNLP 2024 & AAAI 2026] LLM, VLM 및 비디오 생성 모델을 포함한 대규모 모델 압축을 위한 강력한 툴킷입니다.
★ 747+1최근 7일 스타 변화 - #53
[ICML 2024] SqueezeLLM: 조밀 및 희소 양자화
★ 724+0최근 7일 스타 변화 - #54
Hailo Model Zoo는 사전 학습된 모델과 전체 빌드 및 평가 환경을 포함합니다.
★ 703+3최근 7일 스타 변화 - #55
SINQ 공식 저장소입니다. 정확도를 유지하면서 모든 대규모 언어 모델(LLM)의 크기를 줄이도록 설계된 새롭고 빠르며 고품질인 양자화 방법입니다 [ICML 2026].
★ 630+0최근 7일 스타 변화 - #56★ 605+35최근 7일 스타 변화
- #57
양자화된 최신 CLIP 모델과 ONNX Runtime 추론 엔진을 기반으로 Android에서 오프라인으로 작동하는 의미론적 Text-to-Image 및 Image-to-Image 검색
★ 598+1최근 7일 스타 변화 - #58★ 584+0최근 7일 스타 변화
- #59
onnx를 keras나 tflite로 변환하는 도구입니다.
★ 579+0최근 7일 스타 변화 - #60
교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.
★ 566+46최근 7일 스타 변화