본문으로 건너뛰기
buildradar
Sign in
토픽 · quantization

quantization

quantization 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 62개
  • rwkv.cpp@RWKV

    RWKV 언어 모델을 위한 CPU 기반 INT4/INT5/INT8 및 FP16 추론

    1,579+0최근 7일 스타 변화
  • model-optimization@tensorflow

    양자화 및 가지치기(pruning)를 포함하여 배포를 위해 Keras 및 TensorFlow의 ML 모델을 최적화하는 툴킷

    1,578+0최근 7일 스타 변화
  • brevitas@Xilinx

    Brevitas: PyTorch의 신경망 양자화

    1,568+1최근 7일 스타 변화
  • gpu_poor@RahulSChand

    모든 LLM의 토큰/초 및 GPU 메모리 요구량을 계산합니다. llama.cpp/ggml/bnb/QLoRA 양자화 지원

    1,406+1최근 7일 스타 변화
  • geti@open-edge-platform

    적은 데이터와 짧은 시간에 컴퓨터 비전 모델 구축.

    1,325+7최근 7일 스타 변화
  • Efficient-Computing@huawei-noah

    화웨이 노아스 아크 연구소(Huawei Noah's Ark Lab)에서 개발한 고효율 연산 방법

    1,307+0최근 7일 스타 변화
  • GPTQModel@ModelCloud

    HF, vLLM, SGLang을 통해 Nvidia, AMD, Intel GPU 및 Intel/AMD/Apple CPU의 하드웨어 가속을 지원하는 LLM 모델 양자화(압축) 툴킷.

    1,248+2최근 7일 스타 변화
  • nncf@openvinotoolkit

    OpenVINO™ 추론 성능 향상을 위한 신경망 압축 프레임워크

    1,197+4최근 7일 스타 변화
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,158+317최근 7일 스타 변화
  • marlin@IST-DASLab

    16~32 토큰의 중간 배치 크기에서 이상치에 가까운 약 4배의 속도 향상을 달성할 수 있는 FP16xINT4 LLM 추론 커널

    1,138+2최근 7일 스타 변화
  • z80ai@HarryR

    Z80-μLM은 8비트 Z80 프로세서에서 실행될 만큼 작은 2비트 양자화 언어 모델입니다. Python으로 대화형 모델을 학습시키고 CP/M .COM 바이너리로 내보내 빈티지 컴퓨터와 대화할 수 있습니다.

    1,119+1최근 7일 스타 변화
  • optimum-quanto@huggingface

    optimum을 위한 PyTorch 양자화 백엔드

    1,053+1최근 7일 스타 변화
  • finn@Xilinx

    FPGA에서의 QNN 추론을 위한 데이터플로우 컴파일러

    1,049+2최근 7일 스타 변화
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: 모든 모델의 추론을 가속화하는 학습 없는 희소 어텐션(sparse attention).

    1,043+10최근 7일 스타 변화
  • onnx2tf@PINTO0309

    ONNX 파일을 LiteRT/TFLite/TensorFlow, PyTorch 네이티브 코드(nn.Module), TorchScript(.pt), state_dict(.pt), Exported Program(.pt2), Dynamo ONNX로 변환하는 도구입니다. LiteRT에서 PyTorch로의 직접 변환도 지원합니다.

    992+3최근 7일 스타 변화
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: 온디바이스 LLM 추론 라이브러리

    961+0최근 7일 스타 변화
  • hqq@dropbox

    Half-Quadratic Quantization(HQQ) 공식 구현체

    958+1최근 7일 스타 변화
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: IoT 기기를 위한 소형 딥러닝; [NeurIPS 2021] MCUNetV2: 소형 딥러닝을 위한 메모리 효율적인 패치 기반 추론; [NeurIPS 2022] MCUNetV3: 256KB 메모리 하에서의 온디바이스 학습

    957+1최근 7일 스타 변화
  • libimagequant@ImageOptim

    pngquant 및 기타 PNG 최적화 도구를 지원하는 팔레트 양자화 라이브러리

    930+2최근 7일 스타 변화
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant은 LLM을 위한 간단하고 강력한 양자화 기술입니다.

    918+5최근 7일 스타 변화
  • 최근 AI 학회 및 저널의 신경망 양자화 관련 논문 목록입니다.

    851+5최근 7일 스타 변화
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLM, VLM 및 비디오 생성 모델을 포함한 대규모 모델 압축을 위한 강력한 툴킷입니다.

    747+1최근 7일 스타 변화
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: 조밀 및 희소 양자화

    724+0최근 7일 스타 변화
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo는 사전 학습된 모델과 전체 빌드 및 평가 환경을 포함합니다.

    703+3최근 7일 스타 변화
  • SINQ@huawei-csl

    SINQ 공식 저장소입니다. 정확도를 유지하면서 모든 대규모 언어 모델(LLM)의 크기를 줄이도록 설계된 새롭고 빠르며 고품질인 양자화 방법입니다 [ICML 2026].

    630+0최근 7일 스타 변화
  • hipfire@warpfront

    Rust로 작성된 RDNA 네이티브 LLM 추론 엔진

    605+35최근 7일 스타 변화
  • tidy@slavabarkov

    양자화된 최신 CLIP 모델과 ONNX Runtime 추론 엔진을 기반으로 Android에서 오프라인으로 작동하는 의미론적 Text-to-Image 및 Image-to-Image 검색

    598+1최근 7일 스타 변화
  • qkeras@google

    QKeras: Tensorflow Keras를 위한 양자화 딥러닝 라이브러리

    584+0최근 7일 스타 변화
  • onnx2tflite@MPolaris

    onnx를 keras나 tflite로 변환하는 도구입니다.

    579+0최근 7일 스타 변화
  • tessera@zengxiao-he

    교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.

    566+46최근 7일 스타 변화
← 토픽 목록으로