quantization
Dépôts open source suivis étiquetés quantization, triés par étoiles.
- #31★ 1 579+0Évolution des étoiles sur les 7 derniers jours
- #32
Boîte à outils pour optimiser les modèles ML pour le déploiement avec Keras et TensorFlow, incluant la quantification et l'élagage.
★ 1 578+0Évolution des étoiles sur les 7 derniers jours - #33★ 1 568+1Évolution des étoiles sur les 7 derniers jours
- #34
Calcul du nombre de jetons par seconde et des besoins en mémoire GPU pour tout LLM. Prend en charge la quantification llama.cpp/ggml/bnb/QLoRA.
★ 1 406+0Évolution des étoiles sur les 7 derniers jours - #35
Construisez des modèles de vision par ordinateur en une fraction du temps et avec moins de données.
★ 1 325+5Évolution des étoiles sur les 7 derniers jours - #36
Méthodes de calcul efficaces développées par le Huawei Noah's Ark Lab
★ 1 307+0Évolution des étoiles sur les 7 derniers jours - #37
Boîte à outils de quantification (compression) de modèles LLM avec accélération matérielle pour GPU Nvidia, AMD, Intel et CPU Intel/AMD/Apple via HF, vLLM et SGLang.
★ 1 248+0Évolution des étoiles sur les 7 derniers jours - #38
Framework de compression de réseaux de neurones pour une inférence OpenVINO™ optimisée.
★ 1 197+4Évolution des étoiles sur les 7 derniers jours - #39
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1 185+285Évolution des étoiles sur les 7 derniers jours - #40
Noyau d'inférence LLM FP16xINT4 capable d'atteindre des accélérations quasi idéales d'environ 4x pour des tailles de lots moyennes de 16 à 32 jetons.
★ 1 138+2Évolution des étoiles sur les 7 derniers jours - #41
Z80-μLM est un modèle de langage quantifié sur 2 bits suffisamment petit pour fonctionner sur un processeur Z80 8 bits. Entraînez des modèles conversationnels en Python, exportez-les en binaires .COM CP/M et discutez avec votre ordinateur vintage.
★ 1 119+2Évolution des étoiles sur les 7 derniers jours - #42
Un backend de quantification PyTorch pour optimum.
★ 1 053-1Évolution des étoiles sur les 7 derniers jours - #43★ 1 049+4Évolution des étoiles sur les 7 derniers jours
- #44
[ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.
★ 1 043+1Évolution des étoiles sur les 7 derniers jours - #45
Outil de conversion de fichiers ONNX vers LiteRT/TFLite/TensorFlow, code natif PyTorch (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2) et Dynamo ONNX. Supporte également la conversion directe de LiteRT vers PyTorch.
★ 992+2Évolution des étoiles sur les 7 derniers jours - #46
TinyChatEngine : bibliothèque d'inférence LLM sur appareil.
★ 961+0Évolution des étoiles sur les 7 derniers jours - #47★ 958+3Évolution des étoiles sur les 7 derniers jours
- #48
[NeurIPS 2020] MCUNet : apprentissage profond miniature pour appareils IoT ; [NeurIPS 2021] MCUNetV2 : inférence par patchs économe en mémoire pour l'apprentissage profond miniature ; [NeurIPS 2022] MCUNetV3 : entraînement sur appareil avec moins de 256 Ko de mémoire.
★ 957+3Évolution des étoiles sur les 7 derniers jours - #49
Bibliothèque de quantification de palette qui alimente pngquant et d'autres optimiseurs PNG
★ 930+1Évolution des étoiles sur les 7 derniers jours - #50
[ICLR2024 spotlight] OmniQuant est une technique de quantification simple et puissante pour les LLM.
★ 918+8Évolution des étoiles sur les 7 derniers jours - #51
Liste d'articles liés à la quantification des réseaux de neurones dans les conférences et journaux d'IA récents.
★ 851+6Évolution des étoiles sur les 7 derniers jours - #52
[EMNLP 2024 & AAAI 2026] Une boîte à outils puissante pour la compression de grands modèles, incluant les LLM, les VLM et les modèles génératifs vidéo.
★ 747+4Évolution des étoiles sur les 7 derniers jours - #53
[ICML 2024] SqueezeLLM : Quantification dense et éparse
★ 724+1Évolution des étoiles sur les 7 derniers jours - #54
Le Hailo Model Zoo comprend des modèles pré-entraînés ainsi qu'un environnement complet de construction et d'évaluation
★ 704+2Évolution des étoiles sur les 7 derniers jours - #55
Bienvenue sur le dépôt officiel de SINQ ! Une méthode de quantification novatrice, rapide et de haute qualité conçue pour réduire la taille de n'importe quel Grand Modèle de Langage (LLM) tout en préservant sa précision [ICML 2026]
★ 630+1Évolution des étoiles sur les 7 derniers jours - #56★ 608+42Évolution des étoiles sur les 7 derniers jours
- #57
Recherche sémantique hors ligne texte-image et image-image sur Android, optimisée par un modèle pré-entraîné vision-langage CLIP quantifié de pointe et le moteur d'inférence ONNX Runtime
★ 599+1Évolution des étoiles sur les 7 derniers jours - #58★ 584+0Évolution des étoiles sur les 7 derniers jours
- #59
Outil pour onnx->keras ou onnx->tflite. En espérant qu'il vous sera utile.
★ 579+0Évolution des étoiles sur les 7 derniers jours - #60
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Évolution des étoiles sur les 7 derniers jours