quantization
Các kho mã nguồn mở đang theo dõi được gắn thẻ quantization, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng quantization trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ quantization.
- #1
Mô hình Kimi K3 với 2,78 nghìn tỷ tham số chạy suy luận trên một CPU duy nhất với 8,24 GB RAM. C99 di động: không BLAS, không framework, không GPU.
★ 6.888 - #2
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 908 - #3
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 552
- #1
Tinh chỉnh hiệu quả thống nhất cho hơn 100 LLM & VLM (ACL 2024)
★ 74.443+158Thay đổi số sao trong 7 ngày qua - #2
Chuyển đổi giọng nói thành văn bản Whisper nhanh hơn với CTranslate2
★ 25.135+108Thay đổi số sao trong 7 ngày qua - #3
Mô hình ngôn ngữ lớn Chinese LLaMA & Alpaca + huấn luyện và triển khai cục bộ trên CPU/GPU (Chinese LLaMA & Alpaca LLMs)
★ 18.934+2Thay đổi số sao trong 7 ngày qua - #4
[🔥updating ...] Bot giao dịch định lượng tự động hỗ trợ bởi AI (triển khai hoàn toàn cục bộ) Nền tảng nghiên cứu đầu tư định lượng hỗ trợ bởi AI. 📃 tài liệu trực tuyến: https://ufund-me.github.io/Qbot ✨ :news: qbot-mini: https://github.com/Charmve/iQuant
★ 18.418+46Thay đổi số sao trong 7 ngày qua - #5★ 16.518+308Thay đổi số sao trong 7 ngày qua
- #6
Các mô hình ngôn ngữ lớn có thể truy cập thông qua lượng tử hóa k-bit cho PyTorch.
★ 8.446+16Thay đổi số sao trong 7 ngày qua - #7
Mô hình Kimi K3 với 2,78 nghìn tỷ tham số chạy suy luận trên một CPU duy nhất với 8,24 GB RAM. C99 di động: không BLAS, không framework, không GPU.
★ 6.888+485Thay đổi số sao trong 7 ngày qua - #8★ 5.744+4Thay đổi số sao trong 7 ngày qua
- #9
Côngemy suy luận nhanh cho các mô hình Transformer
★ 4.651+23Thay đổi số sao trong 7 ngày qua - #10
[ICLR2025 Spotlight] SVDQuant: Hấp thụ các giá trị ngoại lai bằng các thành phần hạng thấp cho các mô hình Diffusion 4-bit
★ 3.937+1Thay đổi số sao trong 7 ngày qua - #11
Thư viện tương thích với Transformers để áp dụng các thuật toán nén khác nhau cho LLM nhằm tối ưu hóa việc triển khai với vLLM
★ 3.736+27Thay đổi số sao trong 7 ngày qua - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention đạt tốc độ xử lý nhanh hơn 2-5 lần so với FlashAttention, mà không làm giảm các chỉ số tổng thể trên các mô hình ngôn ngữ, hình ảnh và video.
★ 3.685+23Thay đổi số sao trong 7 ngày qua - #13
🚀 Tăng tốc suy luận và huấn luyện 🤗 Transformers, Diffusers, TIMM và Sentence Transformers với các công cụ tối ưu hóa phần cứng dễ sử dụng
★ 3.473+9Thay đổi số sao trong 7 ngày qua - #14
Mô hình ngôn ngữ được huấn luyện trước và các kỹ thuật tối ưu hóa liên quan do Phòng thí nghiệm Noah's Ark của Huawei phát triển.
★ 3.166+1Thay đổi số sao trong 7 ngày qua - #15★ 2.959+7Thay đổi số sao trong 7 ngày qua
- #16
Plugin ComfyUI của Nunchaku
★ 2.920+2Thay đổi số sao trong 7 ngày qua - #17
Bản ghi nhớ dành cho phỏng vấn kỹ thuật AI – Câu hỏi và Trả lời.
★ 2.888+112Thay đổi số sao trong 7 ngày qua - #18
Lượng tử hóa LLM low-bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & độ thưa (sparsity); các kỹ thuật nén mô hình hàng đầu trên PyTorch, TensorFlow và ONNX Runtime
★ 2.706+5Thay đổi số sao trong 7 ngày qua - #19
AIMET là một thư viện cung cấp các kỹ thuật lượng tử hóa và nén nâng cao cho các mô hình mạng nơ-ron đã được huấn luyện.
★ 2.690+7Thay đổi số sao trong 7 ngày qua - #20
Xây dựng, cá nhân hóa và điều khiển LLM của riêng bạn. Từ tiền xử lý dữ liệu đến tinh chỉnh, xTuring cung cấp cách dễ dàng để cá nhân hóa các LLM mã nguồn mở. Tham gia cộng đồng discord của chúng tôi: https://discord.gg/TgHXuSJEk6
★ 2.674+0Thay đổi số sao trong 7 ngày qua - #21
Danh sách các bài báo, tài liệu, mã nguồn về lượng tử hóa mô hình. Kho lưu trữ này nhằm cung cấp thông tin cho nghiên cứu lượng tử hóa mô hình, chúng tôi đang liên tục cải thiện dự án. Chào đón các PR cho các công trình (bài báo, repository) bị thiếu.
★ 2.433+4Thay đổi số sao trong 7 ngày qua - #22
Làm chủ AI ứng dụng qua từng khái niệm
★ 2.377-1Thay đổi số sao trong 7 ngày qua - #23
Chạy các mô hình Mixtral-8x7B trên Colab hoặc máy tính cá nhân
★ 2.333+1Thay đổi số sao trong 7 ngày qua - #24
micronet, thư viện nén và triển khai mô hình. nén: 1、lượng tử hóa: lượng tử hóa khi huấn luyện (QAT), High-Bit (>2b), Low-Bit (≤2b); lượng tử hóa sau huấn luyện (PTQ), 8-bit (tensorrt); 2、cắt tỉa: cắt tỉa kênh tích chập thông thường, đều và theo nhóm; 3、group
★ 2.266+0Thay đổi số sao trong 7 ngày qua - #25★ 1.923+6Thay đổi số sao trong 7 ngày qua
- #26★ 1.817+2Thay đổi số sao trong 7 ngày qua
- #27★ 1.682+0Thay đổi số sao trong 7 ngày qua
- #28
PaddleSlim là một thư viện mã nguồn mở dùng để nén mô hình sâu và tìm kiếm kiến trúc.
★ 1.612+1Thay đổi số sao trong 7 ngày qua - #29
Thuật toán lượng tử hóa SOTA cho suy luận LLM low-bit độ chính xác cao, được tối ưu hóa liền mạch cho CPU/XPU/CUDA, hỗ trợ đa kiểu dữ liệu và tương thích hoàn toàn với vLLM, SGLang và Transformers.
★ 1.594+15Thay đổi số sao trong 7 ngày qua - #30★ 1.579-1Thay đổi số sao trong 7 ngày qua