Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · quantization

quantization

Các kho mã nguồn mở đang theo dõi được gắn thẻ quantization, sắp xếp theo số sao.

62 kho mã
  • rwkv.cpp@RWKV

    Suy luận INT4/INT5/INT8 và FP16 trên CPU cho mô hình ngôn ngữ RWKV

    1.579+0Thay đổi số sao trong 7 ngày qua
  • model-optimization@tensorflow

    Bộ công cụ tối ưu hóa các mô hình ML để triển khai cho Keras và TensorFlow, bao gồm lượng tử hóa và tỉa nhánh.

    1.578+0Thay đổi số sao trong 7 ngày qua
  • brevitas@Xilinx

    Brevitas: lượng tử hóa mạng nơ-ron trong PyTorch

    1.568+1Thay đổi số sao trong 7 ngày qua
  • gpu_poor@RahulSChand

    Tính toán tốc độ token/s và yêu cầu bộ nhớ GPU cho bất kỳ LLM nào. Hỗ trợ lượng tử hóa llama.cpp/ggml/bnb/QLoRA.

    1.406+0Thay đổi số sao trong 7 ngày qua
  • geti@open-edge-platform

    Xây dựng các mô hình thị giác máy tính trong thời gian ngắn hơn và với ít dữ liệu hơn.

    1.325+5Thay đổi số sao trong 7 ngày qua
  • Efficient-Computing@huawei-noah

    Các phương pháp tính toán hiệu quả được phát triển bởi Huawei Noah's Ark Lab

    1.307+0Thay đổi số sao trong 7 ngày qua
  • GPTQModel@ModelCloud

    Bộ công cụ lượng tử hóa (nén) mô hình LLM hỗ trợ tăng tốc phần cứng cho GPU Nvidia, AMD, Intel và CPU Intel/AMD/Apple thông qua HF, vLLM và SGLang.

    1.248+0Thay đổi số sao trong 7 ngày qua
  • nncf@openvinotoolkit

    Framework nén mạng nơ-ron để tăng cường suy luận OpenVINO™

    1.197+4Thay đổi số sao trong 7 ngày qua
  • Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.

    1.196+285Thay đổi số sao trong 7 ngày qua
  • marlin@IST-DASLab

    Kernel suy luận LLM FP16xINT4 có thể đạt tốc độ nhanh gấp ~4 lần gần như lý tưởng với kích thước batch trung bình từ 16-32 token.

    1.138+2Thay đổi số sao trong 7 ngày qua
  • z80ai@HarryR

    Z80-μLM là một mô hình ngôn ngữ lượng tử hóa 2-bit đủ nhỏ để chạy trên bộ vi xử lý 8-bit Z80. Huấn luyện mô hình hội thoại bằng Python, xuất ra các tệp nhị phân CP/M .COM và trò chuyện với máy tính cổ điển của bạn.

    1.119+2Thay đổi số sao trong 7 ngày qua
  • finn@Xilinx

    Trình biên dịch luồng dữ liệu cho suy luận QNN trên FPGA

    1.053+4Thay đổi số sao trong 7 ngày qua
  • optimum-quanto@huggingface

    Một backend lượng tử hóa PyTorch cho optimum.

    1.053-1Thay đổi số sao trong 7 ngày qua
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Cơ chế chú ý thưa thớt không cần huấn luyện giúp tăng tốc suy luận của mọi mô hình.

    1.045+1Thay đổi số sao trong 7 ngày qua
  • onnx2tf@PINTO0309

    Công cụ chuyển đổi tệp ONNX sang LiteRT/TFLite/TensorFlow, mã nguồn gốc PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) và Dynamo ONNX. Công cụ này cũng hỗ trợ chuyển đổi trực tiếp từ LiteRT sang PyTorch.

    993+2Thay đổi số sao trong 7 ngày qua
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: Thư viện suy luận LLM trên thiết bị

    961+0Thay đổi số sao trong 7 ngày qua
  • hqq@dropbox

    Bản cài đặt chính thức của Half-Quadratic Quantization (HQQ)

    958+3Thay đổi số sao trong 7 ngày qua
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: Deep Learning nhỏ gọn trên thiết bị IoT; [NeurIPS 2021] MCUNetV2: Suy luận dựa trên bản patch tiết kiệm bộ nhớ cho Deep Learning nhỏ gọn; [NeurIPS 2022] MCUNetV3: Huấn luyện trên thiết bị với bộ nhớ dưới 256KB

    957+3Thay đổi số sao trong 7 ngày qua
  • libimagequant@ImageOptim

    Thư viện lượng tử hóa bảng màu cung cấp năng lượng cho pngquant và các trình tối ưu hóa PNG khác

    931+1Thay đổi số sao trong 7 ngày qua
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant là một kỹ thuật lượng tử hóa đơn giản và mạnh mẽ dành cho LLM.

    919+8Thay đổi số sao trong 7 ngày qua
  • Danh sách các bài báo liên quan đến lượng tử hóa mạng thần kinh tại các hội nghị và tạp chí AI gần đây.

    851+6Thay đổi số sao trong 7 ngày qua
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Bộ công cụ mạnh mẽ để nén các mô hình lớn bao gồm LLM, VLM và các mô hình tạo video

    747+4Thay đổi số sao trong 7 ngày qua
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: Lượng tử hóa dày đặc và thưa thớt (Dense-and-Sparse Quantization).

    724+1Thay đổi số sao trong 7 ngày qua
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo bao gồm các mô hình đã được huấn luyện sẵn cùng môi trường xây dựng và đánh giá đầy đủ

    704+2Thay đổi số sao trong 7 ngày qua
  • SINQ@huawei-csl

    Kho lưu trữ chính thức của SINQ! Một phương pháp lượng tử hóa mới, nhanh và chất lượng cao được thiết kế để làm cho bất kỳ Large Language Model nào nhỏ hơn trong khi vẫn duy trì độ chính xác [ICML 2026].

    630+1Thay đổi số sao trong 7 ngày qua
  • hipfire@warpfront

    Công cụ suy luận LLM hỗ trợ RDNA gốc viết bằng Rust

    608+42Thay đổi số sao trong 7 ngày qua
  • tidy@slavabarkov

    Tìm kiếm Text-to-Image và Image-to-Image ngữ nghĩa ngoại tuyến trên Android, được hỗ trợ bởi mô hình CLIP tiền huấn luyện tiên tiến đã được lượng tử hóa và công cụ suy luận ONNX Runtime

    599+1Thay đổi số sao trong 7 ngày qua
  • qkeras@google

    QKeras: thư viện học sâu lượng tử hóa cho Tensorflow Keras

    584+0Thay đổi số sao trong 7 ngày qua
  • onnx2tflite@MPolaris

    Công cụ chuyển đổi onnx sang keras hoặc onnx sang tflite. Hy vọng công cụ này hữu ích cho bạn.

    579+0Thay đổi số sao trong 7 ngày qua
  • tessera@zengxiao-he

    Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.

    566+30Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề