본문으로 건너뛰기
buildradar
Sign in
토픽 · quantization

quantization

quantization 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
62
총 스타
264,169
평균 스타
4,261
비중
0.01%

같은 리포지토리에 quantization 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 quantization 태그가 달린 리포지토리예요.

  • kimi-k3-in-c@FareedKhan-dev

    단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.

    6,918
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    969
  • tessera@zengxiao-he

    교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.

    559
  • LlamaFactory@hiyouga

    100개 이상의 LLM 및 VLM을 위한 통합 효율적 미세 조정(ACL 2024)

    74,443+158최근 7일 스타 변화
  • faster-whisper@SYSTRAN

    CTranslate2를 사용한 더 빠른 Whisper 전사

    25,135+108최근 7일 스타 변화
  • 중국어 LLaMA 및 Alpaca 대규모 언어 모델 + 로컬 CPU/GPU 학습 및 배포 (Chinese LLaMA & Alpaca LLMs)

    18,934+2최근 7일 스타 변화
  • Qbot@UFund-Me

    [🔥업데이트 중 ...] AI 자동 퀀트 트레이딩 봇 (완전 로컬 배포) AI 기반 퀀트 투자 연구 플랫폼. 📃 온라인 문서: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant

    18,418+46최근 7일 스타 변화
  • turbovec@RyanCodrai

    TurboQuant 기반의 벡터 인덱스로, Python 바인딩이 포함된 Rust로 작성되었습니다.

    16,518+308최근 7일 스타 변화
  • bitsandbytes@bitsandbytes-foundation

    PyTorch를 위한 k-bit 양자화를 통한 접근 가능한 대형 언어 모델

    8,446+16최근 7일 스타 변화
  • kimi-k3-in-c@FareedKhan-dev

    단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.

    6,918+485최근 7일 스타 변화
  • pngquant@kornelski

    손실 압축 PNG 압축기 — libimagequant 라이브러리 기반의 pngquant 명령어

    5,744+4최근 7일 스타 변화
  • CTranslate2@OpenNMT

    Transformer 모델을 위한 빠른 추론 엔진

    4,651+23최근 7일 스타 변화
  • nunchaku@nunchaku-ai

    [ICLR2025 Spotlight] SVDQuant: 4비트 Diffusion 모델을 위한 저랭크 컴포넌트를 통한 이상치 흡수

    3,937+1최근 7일 스타 변화
  • llm-compressor@vllm-project

    vLLM을 통한 최적화된 배포를 위해 LLM에 다양한 압축 알고리즘을 적용하는 Transformers 호환 라이브러리

    3,736+27최근 7일 스타 변화
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention은 언어, 이미지, 비디오 모델 전반에서 엔드투엔드 메트릭 손실 없이 FlashAttention 대비 2~5배의 속도 향상을 달성합니다.

    3,685+23최근 7일 스타 변화
  • optimum@huggingface

    🚀 사용하기 쉬운 하드웨어 최적화 도구로 🤗 Transformers, Diffusers, TIMM 및 Sentence Transformers의 추론 및 학습을 가속화하세요.

    3,473+9최근 7일 스타 변화
  • 화웨이 노아스 아크 랩(Huawei Noah's Ark Lab)에서 개발한 사전 학습된 언어 모델 및 관련 최적화 기법.

    3,166+1최근 7일 스타 변화
  • ao@pytorch

    학습 및 추론을 위한 PyTorch 기본 양자화

    2,959+7최근 7일 스타 변화
  • ComfyUI-nunchaku@nunchaku-ai

    Nunchaku의 ComfyUI 플러그인

    2,920+2최근 7일 스타 변화
  • ai-engineering-interview-questions@amitshekhariitbhu

    AI 엔지니어링 면접을 위한 치트 시트 – 질문과 답변

    2,888+112최근 7일 스타 변화
  • SOTA 저비트 LLM 양자화(INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) 및 희소성(sparsity); PyTorch, TensorFlow, ONNX Runtime을 지원하는 선도적인 모델 압축 기술

    2,706+5최근 7일 스타 변화
  • aimet@qualcomm

    AIMET은 학습된 신경망 모델을 위한 고급 양자화 및 압축 기술을 제공하는 라이브러리입니다.

    2,690+7최근 7일 스타 변화
  • xTuring@stochasticai

    나만의 LLM을 구축, 개인화 및 제어하세요. 데이터 전처리부터 파인튜닝까지, xTuring은 오픈소스 LLM을 개인화하는 쉬운 방법을 제공합니다.

    2,674+0최근 7일 스타 변화
  • 모델 양자화에 관한 논문, 문서, 코드 목록. 본 저장소는 모델 양자화 연구 정보를 제공하기 위한 것이며 지속적으로 개선되고 있습니다. 누락된 연구(논문, 저장소)는 PR을 환영합니다.

    2,433+4최근 7일 스타 변화
  • AI-Engineering.academy@adithya-s-k

    실용 AI 마스터하기, 한 번에 하나의 개념씩

    2,377-1최근 7일 스타 변화
  • mixtral-offloading@dvmazur

    Colab 또는 일반 데스크톱에서 Mixtral-8x7B 모델 실행

    2,333+1최근 7일 스타 변화
  • micronet@666DZY666

    모델 압축 및 배포 라이브러리 micronet. 압축: 1. 양자화(quantization): QAT, High-Bit, Low-Bit/Ternary 및 Binary; PTQ, 8-bit; 2. 가지치기(pruning): 일반, 정규 및 그룹 컨볼루셔널 채널 가지치기; 3. 그룹

    2,266+0최근 7일 스타 변화
  • picolm@RightNow-AI

    256MB RAM이 탑재된 10달러짜리 보드에서 10억 개의 매개변수를 가진 LLM 실행

    1,923+6최근 7일 스타 변화
  • ppq@OpenPPL

    PPL Quantization Tool (PPQ)은 강력한 오프라인 신경망 양자화 도구입니다.

    1,817+2최근 7일 스타 변화
  • mmrazor@open-mmlab

    OpenMMLab 모델 압축 툴박스 및 벤치마크

    1,682+0최근 7일 스타 변화
  • PaddleSlim@PaddlePaddle

    PaddleSlim은 딥 모델 압축 및 아키텍처 탐색을 위한 오픈소스 라이브러리입니다.

    1,612+1최근 7일 스타 변화
  • auto-round@intel

    고정밀 저비트 LLM 추론을 위한 SOTA 양자화 알고리즘. CPU/XPU/CUDA에 최적화되었으며, 다양한 데이터 타입을 지원하고 vLLM, SGLang, Transformers와 완벽히 호환됩니다.

    1,594+15최근 7일 스타 변화
  • rwkv.cpp@RWKV

    RWKV 언어 모델을 위한 CPU 기반 INT4/INT5/INT8 및 FP16 추론

    1,579-1최근 7일 스타 변화
← 토픽 목록으로