Zum Hauptinhalt springen
buildradar
Sign in
Thema · quantization

quantization

Erfasste Open-Source-Repos mit dem Tag quantization, sortiert nach Sternen.

62 Repos
  • rwkv.cpp@RWKV

    INT4/INT5/INT8- und FP16-Inferenz auf der CPU für das RWKV-Sprachmodell

    1.579+0Sterne-Änderung der letzten 7 Tage
  • model-optimization@tensorflow

    Ein Toolkit zur Optimierung von ML-Modellen für die Bereitstellung in Keras und TensorFlow, einschließlich Quantisierung und Pruning.

    1.578+0Sterne-Änderung der letzten 7 Tage
  • brevitas@Xilinx

    Brevitas: Neuronale Netz-Quantisierung in PyTorch

    1.568+1Sterne-Änderung der letzten 7 Tage
  • gpu_poor@RahulSChand

    Berechnet Token/s und GPU-Speicherbedarf für beliebige LLMs. Unterstützt llama.cpp/ggml/bnb/QLoRA-Quantisierung.

    1.406+0Sterne-Änderung der letzten 7 Tage
  • geti@open-edge-platform

    Erstellen Sie Computer-Vision-Modelle in einem Bruchteil der Zeit und mit weniger Daten.

    1.325+5Sterne-Änderung der letzten 7 Tage
  • Efficient-Computing@huawei-noah

    Effiziente Rechenmethoden, entwickelt vom Huawei Noah's Ark Lab

    1.307+0Sterne-Änderung der letzten 7 Tage
  • GPTQModel@ModelCloud

    LLM-Modell-Quantisierungs- (Kompprimierungs-) Toolkit mit Hardware-Beschleunigungsunterstützung für Nvidia-, AMD-, Intel-GPUs und Intel/AMD/Apple-CPUs über HF, vLLM und SGLang.

    1.248+0Sterne-Änderung der letzten 7 Tage
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.197+316Sterne-Änderung der letzten 7 Tage
  • nncf@openvinotoolkit

    Neuronales Netzwerk-Komprimierungsframework für verbesserte OpenVINO™-Inferenz

    1.197+4Sterne-Änderung der letzten 7 Tage
  • marlin@IST-DASLab

    FP16xINT4 LLM-Inferenz-Kernel, der bei mittleren Batchgrößen von 16-32 Token nahezu ideale 4-fache Geschwindigkeitssteigerungen erzielen kann.

    1.138+2Sterne-Änderung der letzten 7 Tage
  • z80ai@HarryR

    Z80-μLM ist ein auf 2 Bit quantisiertes Sprachmodell, das klein genug ist, um auf einem 8-Bit-Z80-Prozessor zu laufen. Trainieren Sie Konversationsmodelle in Python, exportieren Sie sie als CP/M-.COM-Binärdateien und chatten Sie mit Ihrem Vintage-Computer.

    1.119+2Sterne-Änderung der letzten 7 Tage
  • finn@Xilinx

    Dataflow-Compiler für QNN-Inferenz auf FPGAs

    1.053+8Sterne-Änderung der letzten 7 Tage
  • optimum-quanto@huggingface

    Ein PyTorch-Quantisierungs-Backend für optimum

    1.053-1Sterne-Änderung der letzten 7 Tage
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Eine trainingsfreie sparse Attention, die die Inferenz beliebiger Modelle beschleunigt.

    1.045+3Sterne-Änderung der letzten 7 Tage
  • onnx2tf@PINTO0309

    Ein Tool zum Konvertieren von ONNX-Dateien in LiteRT/TFLite/TensorFlow, PyTorch Native Code (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) und Dynamo ONNX. Es unterstützt auch die direkte Konvertierung von LiteRT zu PyTorch.

    993+3Sterne-Änderung der letzten 7 Tage
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: LLM-Inferenzbibliothek für Endgeräte

    961+0Sterne-Änderung der letzten 7 Tage
  • hqq@dropbox

    Offizielle Implementierung von Half-Quadratic Quantization (HQQ)

    958+3Sterne-Änderung der letzten 7 Tage
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: Tiny Deep Learning auf IoT-Geräten; [NeurIPS 2021] MCUNetV2: Speicherffiziente, patch-basierte Inferenz für Tiny Deep Learning; [NeurIPS 2022] MCUNetV3: On-Device-Training unter 256 KB Speicher

    957+3Sterne-Änderung der letzten 7 Tage
  • libimagequant@ImageOptim

    Paletten-Quantisierungsbibliothek, die pngquant und andere PNG-Optimierer antreibt

    931+2Sterne-Änderung der letzten 7 Tage
  • OmniQuant@OpenGVLab

    [ICLR2024 Spotlight] OmniQuant ist eine einfache und leistungsstarke Quantisierungstechnik für LLMs.

    919+9Sterne-Änderung der letzten 7 Tage
  • Liste von Artikeln zur Quantisierung neuronaler Netze auf aktuellen KI-Konferenzen und in Fachzeitschriften.

    851+6Sterne-Änderung der letzten 7 Tage
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Ein leistungsstarkes Toolkit zur Komprimierung großer Modelle einschließlich LLMs, VLMs und Video-Generierungsmodellen.

    747+4Sterne-Änderung der letzten 7 Tage
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: Dense-and-Sparse Quantization

    724+1Sterne-Änderung der letzten 7 Tage
  • hailo_model_zoo@hailo-ai

    Der Hailo Model Zoo enthält vortrainierte Modelle und eine vollständige Erstellungs- und Evaluierungsumgebung

    704+3Sterne-Änderung der letzten 7 Tage
  • SINQ@huawei-csl

    Willkommen im offiziellen Repository von SINQ! Eine neuartige, schnelle und hochwertige Quantisierungsmethode, die entwickelt wurde, um jedes Large Language Model kleiner zu machen und gleichzeitig die Genauigkeit zu erhalten [ICML 2026]

    630+1Sterne-Änderung der letzten 7 Tage
  • hipfire@warpfront

    RDNA-native LLM-Inferenz-Engine in Rust.

    608+45Sterne-Änderung der letzten 7 Tage
  • tidy@slavabarkov

    Offline-semantische Text-zu-Bild- und Bild-zu-Bild-Suche auf Android, angetrieben durch ein quantisiertes, hochmodernes Vision-Language-Modell CLIP und die ONNX Runtime

    599+2Sterne-Änderung der letzten 7 Tage
  • qkeras@google

    QKeras: eine Quantisierungs-Deep-Learning-Bibliothek für Tensorflow Keras

    584+0Sterne-Änderung der letzten 7 Tage
  • onnx2tflite@MPolaris

    Tool für die Konvertierung von ONNX zu Keras oder ONNX zu TFLite.

    579+0Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    566+30Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen