quantization
Erfasste Open-Source-Repos mit dem Tag quantization, sortiert nach Sternen.
- #31★ 1.579+0Sterne-Änderung der letzten 7 Tage
- #32
Ein Toolkit zur Optimierung von ML-Modellen für die Bereitstellung in Keras und TensorFlow, einschließlich Quantisierung und Pruning.
★ 1.578+0Sterne-Änderung der letzten 7 Tage - #33★ 1.568+1Sterne-Änderung der letzten 7 Tage
- #34
Berechnet Token/s und GPU-Speicherbedarf für beliebige LLMs. Unterstützt llama.cpp/ggml/bnb/QLoRA-Quantisierung.
★ 1.406+0Sterne-Änderung der letzten 7 Tage - #35
Erstellen Sie Computer-Vision-Modelle in einem Bruchteil der Zeit und mit weniger Daten.
★ 1.325+5Sterne-Änderung der letzten 7 Tage - #36
Effiziente Rechenmethoden, entwickelt vom Huawei Noah's Ark Lab
★ 1.307+0Sterne-Änderung der letzten 7 Tage - #37
LLM-Modell-Quantisierungs- (Kompprimierungs-) Toolkit mit Hardware-Beschleunigungsunterstützung für Nvidia-, AMD-, Intel-GPUs und Intel/AMD/Apple-CPUs über HF, vLLM und SGLang.
★ 1.248+0Sterne-Änderung der letzten 7 Tage - #38
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.197+316Sterne-Änderung der letzten 7 Tage - #39★ 1.197+4Sterne-Änderung der letzten 7 Tage
- #40
FP16xINT4 LLM-Inferenz-Kernel, der bei mittleren Batchgrößen von 16-32 Token nahezu ideale 4-fache Geschwindigkeitssteigerungen erzielen kann.
★ 1.138+2Sterne-Änderung der letzten 7 Tage - #41
Z80-μLM ist ein auf 2 Bit quantisiertes Sprachmodell, das klein genug ist, um auf einem 8-Bit-Z80-Prozessor zu laufen. Trainieren Sie Konversationsmodelle in Python, exportieren Sie sie als CP/M-.COM-Binärdateien und chatten Sie mit Ihrem Vintage-Computer.
★ 1.119+2Sterne-Änderung der letzten 7 Tage - #42★ 1.053+8Sterne-Änderung der letzten 7 Tage
- #43
Ein PyTorch-Quantisierungs-Backend für optimum
★ 1.053-1Sterne-Änderung der letzten 7 Tage - #44
[ICML2025] SpargeAttention: Eine trainingsfreie sparse Attention, die die Inferenz beliebiger Modelle beschleunigt.
★ 1.045+3Sterne-Änderung der letzten 7 Tage - #45
Ein Tool zum Konvertieren von ONNX-Dateien in LiteRT/TFLite/TensorFlow, PyTorch Native Code (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) und Dynamo ONNX. Es unterstützt auch die direkte Konvertierung von LiteRT zu PyTorch.
★ 993+3Sterne-Änderung der letzten 7 Tage - #46
TinyChatEngine: LLM-Inferenzbibliothek für Endgeräte
★ 961+0Sterne-Änderung der letzten 7 Tage - #47★ 958+3Sterne-Änderung der letzten 7 Tage
- #48
[NeurIPS 2020] MCUNet: Tiny Deep Learning auf IoT-Geräten; [NeurIPS 2021] MCUNetV2: Speicherffiziente, patch-basierte Inferenz für Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device-Training unter 256 KB Speicher
★ 957+3Sterne-Änderung der letzten 7 Tage - #49
Paletten-Quantisierungsbibliothek, die pngquant und andere PNG-Optimierer antreibt
★ 931+2Sterne-Änderung der letzten 7 Tage - #50
[ICLR2024 Spotlight] OmniQuant ist eine einfache und leistungsstarke Quantisierungstechnik für LLMs.
★ 919+9Sterne-Änderung der letzten 7 Tage - #51
Liste von Artikeln zur Quantisierung neuronaler Netze auf aktuellen KI-Konferenzen und in Fachzeitschriften.
★ 851+6Sterne-Änderung der letzten 7 Tage - #52
[EMNLP 2024 & AAAI 2026] Ein leistungsstarkes Toolkit zur Komprimierung großer Modelle einschließlich LLMs, VLMs und Video-Generierungsmodellen.
★ 747+4Sterne-Änderung der letzten 7 Tage - #53
[ICML 2024] SqueezeLLM: Dense-and-Sparse Quantization
★ 724+1Sterne-Änderung der letzten 7 Tage - #54
Der Hailo Model Zoo enthält vortrainierte Modelle und eine vollständige Erstellungs- und Evaluierungsumgebung
★ 704+3Sterne-Änderung der letzten 7 Tage - #55
Willkommen im offiziellen Repository von SINQ! Eine neuartige, schnelle und hochwertige Quantisierungsmethode, die entwickelt wurde, um jedes Large Language Model kleiner zu machen und gleichzeitig die Genauigkeit zu erhalten [ICML 2026]
★ 630+1Sterne-Änderung der letzten 7 Tage - #56★ 608+45Sterne-Änderung der letzten 7 Tage
- #57
Offline-semantische Text-zu-Bild- und Bild-zu-Bild-Suche auf Android, angetrieben durch ein quantisiertes, hochmodernes Vision-Language-Modell CLIP und die ONNX Runtime
★ 599+2Sterne-Änderung der letzten 7 Tage - #58★ 584+0Sterne-Änderung der letzten 7 Tage
- #59
Tool für die Konvertierung von ONNX zu Keras oder ONNX zu TFLite.
★ 579+0Sterne-Änderung der letzten 7 Tage - #60
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 566+30Sterne-Änderung der letzten 7 Tage