quantization
quantization 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 quantization 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 quantization 태그가 달린 리포지토리예요.
- #1
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,918 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 969 - #3
교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.
★ 559
- #1
100개 이상의 LLM 및 VLM을 위한 통합 효율적 미세 조정(ACL 2024)
★ 74,443+158최근 7일 스타 변화 - #2
CTranslate2를 사용한 더 빠른 Whisper 전사
★ 25,135+108최근 7일 스타 변화 - #3
중국어 LLaMA 및 Alpaca 대규모 언어 모델 + 로컬 CPU/GPU 학습 및 배포 (Chinese LLaMA & Alpaca LLMs)
★ 18,934+2최근 7일 스타 변화 - #4
[🔥업데이트 중 ...] AI 자동 퀀트 트레이딩 봇 (완전 로컬 배포) AI 기반 퀀트 투자 연구 플랫폼. 📃 온라인 문서: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18,418+46최근 7일 스타 변화 - #5★ 16,518+308최근 7일 스타 변화
- #6
PyTorch를 위한 k-bit 양자화를 통한 접근 가능한 대형 언어 모델
★ 8,446+16최근 7일 스타 변화 - #7
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,918+485최근 7일 스타 변화 - #8★ 5,744+4최근 7일 스타 변화
- #9
Transformer 모델을 위한 빠른 추론 엔진
★ 4,651+23최근 7일 스타 변화 - #10★ 3,937+1최근 7일 스타 변화
- #11
vLLM을 통한 최적화된 배포를 위해 LLM에 다양한 압축 알고리즘을 적용하는 Transformers 호환 라이브러리
★ 3,736+27최근 7일 스타 변화 - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention은 언어, 이미지, 비디오 모델 전반에서 엔드투엔드 메트릭 손실 없이 FlashAttention 대비 2~5배의 속도 향상을 달성합니다.
★ 3,685+23최근 7일 스타 변화 - #13
🚀 사용하기 쉬운 하드웨어 최적화 도구로 🤗 Transformers, Diffusers, TIMM 및 Sentence Transformers의 추론 및 학습을 가속화하세요.
★ 3,473+9최근 7일 스타 변화 - #14
화웨이 노아스 아크 랩(Huawei Noah's Ark Lab)에서 개발한 사전 학습된 언어 모델 및 관련 최적화 기법.
★ 3,166+1최근 7일 스타 변화 - #15★ 2,959+7최근 7일 스타 변화
- #16
Nunchaku의 ComfyUI 플러그인
★ 2,920+2최근 7일 스타 변화 - #17
AI 엔지니어링 면접을 위한 치트 시트 – 질문과 답변
★ 2,888+112최근 7일 스타 변화 - #18
SOTA 저비트 LLM 양자화(INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) 및 희소성(sparsity); PyTorch, TensorFlow, ONNX Runtime을 지원하는 선도적인 모델 압축 기술
★ 2,706+5최근 7일 스타 변화 - #19★ 2,690+7최근 7일 스타 변화
- #20
나만의 LLM을 구축, 개인화 및 제어하세요. 데이터 전처리부터 파인튜닝까지, xTuring은 오픈소스 LLM을 개인화하는 쉬운 방법을 제공합니다.
★ 2,674+0최근 7일 스타 변화 - #21
모델 양자화에 관한 논문, 문서, 코드 목록. 본 저장소는 모델 양자화 연구 정보를 제공하기 위한 것이며 지속적으로 개선되고 있습니다. 누락된 연구(논문, 저장소)는 PR을 환영합니다.
★ 2,433+4최근 7일 스타 변화 - #22
실용 AI 마스터하기, 한 번에 하나의 개념씩
★ 2,377-1최근 7일 스타 변화 - #23
Colab 또는 일반 데스크톱에서 Mixtral-8x7B 모델 실행
★ 2,333+1최근 7일 스타 변화 - #24
모델 압축 및 배포 라이브러리 micronet. 압축: 1. 양자화(quantization): QAT, High-Bit, Low-Bit/Ternary 및 Binary; PTQ, 8-bit; 2. 가지치기(pruning): 일반, 정규 및 그룹 컨볼루셔널 채널 가지치기; 3. 그룹
★ 2,266+0최근 7일 스타 변화 - #25★ 1,923+6최근 7일 스타 변화
- #26★ 1,817+2최근 7일 스타 변화
- #27★ 1,682+0최근 7일 스타 변화
- #28
PaddleSlim은 딥 모델 압축 및 아키텍처 탐색을 위한 오픈소스 라이브러리입니다.
★ 1,612+1최근 7일 스타 변화 - #29
고정밀 저비트 LLM 추론을 위한 SOTA 양자화 알고리즘. CPU/XPU/CUDA에 최적화되었으며, 다양한 데이터 타입을 지원하고 vLLM, SGLang, Transformers와 완벽히 호환됩니다.
★ 1,594+15최근 7일 스타 변화 - #30★ 1,579-1최근 7일 스타 변화