Aller au contenu principal
buildradar
Sign in
Sujet · quantization

quantization

Dépôts open source suivis étiquetés quantization, triés par étoiles.

62 dépôts
  • rwkv.cpp@RWKV

    Inférence INT4/INT5/INT8 et FP16 sur CPU pour le modèle de langage RWKV.

    1 579+0Évolution des étoiles sur les 7 derniers jours
  • model-optimization@tensorflow

    Boîte à outils pour optimiser les modèles ML pour le déploiement avec Keras et TensorFlow, incluant la quantification et l'élagage.

    1 578+0Évolution des étoiles sur les 7 derniers jours
  • brevitas@Xilinx

    Brevitas : quantification de réseaux de neurones sous PyTorch

    1 568+1Évolution des étoiles sur les 7 derniers jours
  • gpu_poor@RahulSChand

    Calcul du nombre de jetons par seconde et des besoins en mémoire GPU pour tout LLM. Prend en charge la quantification llama.cpp/ggml/bnb/QLoRA.

    1 406+0Évolution des étoiles sur les 7 derniers jours
  • geti@open-edge-platform

    Construisez des modèles de vision par ordinateur en une fraction du temps et avec moins de données.

    1 325+5Évolution des étoiles sur les 7 derniers jours
  • Efficient-Computing@huawei-noah

    Méthodes de calcul efficaces développées par le Huawei Noah's Ark Lab

    1 307+0Évolution des étoiles sur les 7 derniers jours
  • GPTQModel@ModelCloud

    Boîte à outils de quantification (compression) de modèles LLM avec accélération matérielle pour GPU Nvidia, AMD, Intel et CPU Intel/AMD/Apple via HF, vLLM et SGLang.

    1 248+0Évolution des étoiles sur les 7 derniers jours
  • nncf@openvinotoolkit

    Framework de compression de réseaux de neurones pour une inférence OpenVINO™ optimisée.

    1 197+4Évolution des étoiles sur les 7 derniers jours
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1 185+285Évolution des étoiles sur les 7 derniers jours
  • marlin@IST-DASLab

    Noyau d'inférence LLM FP16xINT4 capable d'atteindre des accélérations quasi idéales d'environ 4x pour des tailles de lots moyennes de 16 à 32 jetons.

    1 138+2Évolution des étoiles sur les 7 derniers jours
  • z80ai@HarryR

    Z80-μLM est un modèle de langage quantifié sur 2 bits suffisamment petit pour fonctionner sur un processeur Z80 8 bits. Entraînez des modèles conversationnels en Python, exportez-les en binaires .COM CP/M et discutez avec votre ordinateur vintage.

    1 119+2Évolution des étoiles sur les 7 derniers jours
  • optimum-quanto@huggingface

    Un backend de quantification PyTorch pour optimum.

    1 053-1Évolution des étoiles sur les 7 derniers jours
  • finn@Xilinx

    Compilateur de flux de données pour l'inférence QNN sur FPGA

    1 049+4Évolution des étoiles sur les 7 derniers jours
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.

    1 043+1Évolution des étoiles sur les 7 derniers jours
  • onnx2tf@PINTO0309

    Outil de conversion de fichiers ONNX vers LiteRT/TFLite/TensorFlow, code natif PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) et Dynamo ONNX. Supporte également la conversion directe de LiteRT vers PyTorch.

    992+2Évolution des étoiles sur les 7 derniers jours
  • TinyChatEngine@mit-han-lab

    TinyChatEngine : bibliothèque d'inférence LLM sur appareil.

    961+0Évolution des étoiles sur les 7 derniers jours
  • hqq@dropbox

    Implémentation officielle de la quantification quadratique partielle (HQQ).

    958+3Évolution des étoiles sur les 7 derniers jours
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet : apprentissage profond miniature pour appareils IoT ; [NeurIPS 2021] MCUNetV2 : inférence par patchs économe en mémoire pour l'apprentissage profond miniature ; [NeurIPS 2022] MCUNetV3 : entraînement sur appareil avec moins de 256 Ko de mémoire.

    957+3Évolution des étoiles sur les 7 derniers jours
  • libimagequant@ImageOptim

    Bibliothèque de quantification de palette qui alimente pngquant et d'autres optimiseurs PNG

    930+1Évolution des étoiles sur les 7 derniers jours
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant est une technique de quantification simple et puissante pour les LLM.

    918+8Évolution des étoiles sur les 7 derniers jours
  • Liste d'articles liés à la quantification des réseaux de neurones dans les conférences et journaux d'IA récents.

    851+6Évolution des étoiles sur les 7 derniers jours
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Une boîte à outils puissante pour la compression de grands modèles, incluant les LLM, les VLM et les modèles génératifs vidéo.

    747+4Évolution des étoiles sur les 7 derniers jours
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM : Quantification dense et éparse

    724+1Évolution des étoiles sur les 7 derniers jours
  • hailo_model_zoo@hailo-ai

    Le Hailo Model Zoo comprend des modèles pré-entraînés ainsi qu'un environnement complet de construction et d'évaluation

    704+2Évolution des étoiles sur les 7 derniers jours
  • SINQ@huawei-csl

    Bienvenue sur le dépôt officiel de SINQ ! Une méthode de quantification novatrice, rapide et de haute qualité conçue pour réduire la taille de n'importe quel Grand Modèle de Langage (LLM) tout en préservant sa précision [ICML 2026]

    630+1Évolution des étoiles sur les 7 derniers jours
  • hipfire@warpfront

    Moteur d'inférence LLM natif RDNA en Rust.

    608+42Évolution des étoiles sur les 7 derniers jours
  • tidy@slavabarkov

    Recherche sémantique hors ligne texte-image et image-image sur Android, optimisée par un modèle pré-entraîné vision-langage CLIP quantifié de pointe et le moteur d'inférence ONNX Runtime

    599+1Évolution des étoiles sur les 7 derniers jours
  • qkeras@google

    QKeras : une bibliothèque de deep learning par quantification pour Tensorflow Keras

    584+0Évolution des étoiles sur les 7 derniers jours
  • onnx2tflite@MPolaris

    Outil pour onnx->keras ou onnx->tflite. En espérant qu'il vous sera utile.

    579+0Évolution des étoiles sur les 7 derniers jours
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+30Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets