quantization
Các kho mã nguồn mở đang theo dõi được gắn thẻ quantization, sắp xếp theo số sao.
- #31★ 1.579+0Thay đổi số sao trong 7 ngày qua
- #32
Bộ công cụ tối ưu hóa các mô hình ML để triển khai cho Keras và TensorFlow, bao gồm lượng tử hóa và tỉa nhánh.
★ 1.578+0Thay đổi số sao trong 7 ngày qua - #33★ 1.568+1Thay đổi số sao trong 7 ngày qua
- #34
Tính toán tốc độ token/s và yêu cầu bộ nhớ GPU cho bất kỳ LLM nào. Hỗ trợ lượng tử hóa llama.cpp/ggml/bnb/QLoRA.
★ 1.406+0Thay đổi số sao trong 7 ngày qua - #35
Xây dựng các mô hình thị giác máy tính trong thời gian ngắn hơn và với ít dữ liệu hơn.
★ 1.325+5Thay đổi số sao trong 7 ngày qua - #36
Các phương pháp tính toán hiệu quả được phát triển bởi Huawei Noah's Ark Lab
★ 1.307+0Thay đổi số sao trong 7 ngày qua - #37
Bộ công cụ lượng tử hóa (nén) mô hình LLM hỗ trợ tăng tốc phần cứng cho GPU Nvidia, AMD, Intel và CPU Intel/AMD/Apple thông qua HF, vLLM và SGLang.
★ 1.248+0Thay đổi số sao trong 7 ngày qua - #38★ 1.197+4Thay đổi số sao trong 7 ngày qua
- #39
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 1.196+285Thay đổi số sao trong 7 ngày qua - #40
Kernel suy luận LLM FP16xINT4 có thể đạt tốc độ nhanh gấp ~4 lần gần như lý tưởng với kích thước batch trung bình từ 16-32 token.
★ 1.138+2Thay đổi số sao trong 7 ngày qua - #41
Z80-μLM là một mô hình ngôn ngữ lượng tử hóa 2-bit đủ nhỏ để chạy trên bộ vi xử lý 8-bit Z80. Huấn luyện mô hình hội thoại bằng Python, xuất ra các tệp nhị phân CP/M .COM và trò chuyện với máy tính cổ điển của bạn.
★ 1.119+2Thay đổi số sao trong 7 ngày qua - #42★ 1.053+4Thay đổi số sao trong 7 ngày qua
- #43
Một backend lượng tử hóa PyTorch cho optimum.
★ 1.053-1Thay đổi số sao trong 7 ngày qua - #44
[ICML2025] SpargeAttention: Cơ chế chú ý thưa thớt không cần huấn luyện giúp tăng tốc suy luận của mọi mô hình.
★ 1.045+1Thay đổi số sao trong 7 ngày qua - #45
Công cụ chuyển đổi tệp ONNX sang LiteRT/TFLite/TensorFlow, mã nguồn gốc PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) và Dynamo ONNX. Công cụ này cũng hỗ trợ chuyển đổi trực tiếp từ LiteRT sang PyTorch.
★ 993+2Thay đổi số sao trong 7 ngày qua - #46
TinyChatEngine: Thư viện suy luận LLM trên thiết bị
★ 961+0Thay đổi số sao trong 7 ngày qua - #47★ 958+3Thay đổi số sao trong 7 ngày qua
- #48
[NeurIPS 2020] MCUNet: Deep Learning nhỏ gọn trên thiết bị IoT; [NeurIPS 2021] MCUNetV2: Suy luận dựa trên bản patch tiết kiệm bộ nhớ cho Deep Learning nhỏ gọn; [NeurIPS 2022] MCUNetV3: Huấn luyện trên thiết bị với bộ nhớ dưới 256KB
★ 957+3Thay đổi số sao trong 7 ngày qua - #49
Thư viện lượng tử hóa bảng màu cung cấp năng lượng cho pngquant và các trình tối ưu hóa PNG khác
★ 931+1Thay đổi số sao trong 7 ngày qua - #50
[ICLR2024 spotlight] OmniQuant là một kỹ thuật lượng tử hóa đơn giản và mạnh mẽ dành cho LLM.
★ 919+8Thay đổi số sao trong 7 ngày qua - #51
Danh sách các bài báo liên quan đến lượng tử hóa mạng thần kinh tại các hội nghị và tạp chí AI gần đây.
★ 851+6Thay đổi số sao trong 7 ngày qua - #52
[EMNLP 2024 & AAAI 2026] Bộ công cụ mạnh mẽ để nén các mô hình lớn bao gồm LLM, VLM và các mô hình tạo video
★ 747+4Thay đổi số sao trong 7 ngày qua - #53
[ICML 2024] SqueezeLLM: Lượng tử hóa dày đặc và thưa thớt (Dense-and-Sparse Quantization).
★ 724+1Thay đổi số sao trong 7 ngày qua - #54
Hailo Model Zoo bao gồm các mô hình đã được huấn luyện sẵn cùng môi trường xây dựng và đánh giá đầy đủ
★ 704+2Thay đổi số sao trong 7 ngày qua - #55
Kho lưu trữ chính thức của SINQ! Một phương pháp lượng tử hóa mới, nhanh và chất lượng cao được thiết kế để làm cho bất kỳ Large Language Model nào nhỏ hơn trong khi vẫn duy trì độ chính xác [ICML 2026].
★ 630+1Thay đổi số sao trong 7 ngày qua - #56★ 608+42Thay đổi số sao trong 7 ngày qua
- #57
Tìm kiếm Text-to-Image và Image-to-Image ngữ nghĩa ngoại tuyến trên Android, được hỗ trợ bởi mô hình CLIP tiền huấn luyện tiên tiến đã được lượng tử hóa và công cụ suy luận ONNX Runtime
★ 599+1Thay đổi số sao trong 7 ngày qua - #58★ 584+0Thay đổi số sao trong 7 ngày qua
- #59
Công cụ chuyển đổi onnx sang keras hoặc onnx sang tflite. Hy vọng công cụ này hữu ích cho bạn.
★ 579+0Thay đổi số sao trong 7 ngày qua - #60
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 566+30Thay đổi số sao trong 7 ngày qua