quantization
Dépôts open source suivis étiquetés quantization, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de quantization sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés quantization.
- #1
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 6 910 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 962 - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 552
- #1
Fine-tuning efficace et unifié de plus de 100 LLM et VLM (ACL 2024).
★ 74 443+158Évolution des étoiles sur les 7 derniers jours - #2
Transcription Faster Whisper optimisée avec CTranslate2
★ 25 135+108Évolution des étoiles sur les 7 derniers jours - #3
Modèles de langage chinois LLaMA & Alpaca avec entraînement et déploiement local sur CPU/GPU.
★ 18 934+2Évolution des étoiles sur les 7 derniers jours - #4
[🔥en cours de mise à jour...] Robot de trading quantitatif automatisé par IA (déploiement entièrement local). Plateforme de recherche en investissement quantitatif basée sur l'IA. 📃 documentation en ligne : https://ufund-me.github.io/Qbot ✨ :news: qbot-mini : https://github.com/Charmve/iQuant
★ 18 418+46Évolution des étoiles sur les 7 derniers jours - #5★ 16 518+308Évolution des étoiles sur les 7 derniers jours
- #6
Grands modèles de langage accessibles via quantification k-bit pour PyTorch.
★ 8 446+16Évolution des étoiles sur les 7 derniers jours - #7
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 6 910+485Évolution des étoiles sur les 7 derniers jours - #8
Compresseur PNG avec perte — commande pngquant basée sur la bibliothèque libimagequant
★ 5 744+4Évolution des étoiles sur les 7 derniers jours - #9
Moteur d'inférence rapide pour les modèles Transformer
★ 4 651+23Évolution des étoiles sur les 7 derniers jours - #10
[ICLR2025 Spotlight] SVDQuant : absorption des valeurs aberrantes par des composants de bas rang pour les modèles de diffusion 4 bits.
★ 3 937+1Évolution des étoiles sur les 7 derniers jours - #11
Bibliothèque compatible avec Transformers pour appliquer divers algorithmes de compression aux LLM, optimisant ainsi leur déploiement avec vLLM.
★ 3 736+27Évolution des étoiles sur les 7 derniers jours - #12
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.
★ 3 685+23Évolution des étoiles sur les 7 derniers jours - #13
Accélérez l'inférence et l'entraînement de 🤗 Transformers, Diffusers, TIMM et Sentence Transformers avec des outils d'optimisation matérielle simples d'utilisation.
★ 3 473+9Évolution des étoiles sur les 7 derniers jours - #14
Modèle de langage pré-entraîné et ses techniques d'optimisation associées développés par le Huawei Noah's Ark Lab.
★ 3 166+1Évolution des étoiles sur les 7 derniers jours - #15★ 2 959+7Évolution des étoiles sur les 7 derniers jours
- #16
Plugin ComfyUI pour Nunchaku.
★ 2 920+2Évolution des étoiles sur les 7 derniers jours - #17
Votre aide-mémoire pour les entretiens en ingénierie IA : questions et réponses.
★ 2 888+112Évolution des étoiles sur les 7 derniers jours - #18
Quantification LLM faible bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) et sparsité ; techniques de compression de modèles de pointe pour PyTorch, TensorFlow et ONNX Runtime.
★ 2 706+5Évolution des étoiles sur les 7 derniers jours - #19
AIMET est une bibliothèque fournissant des techniques avancées de quantification et de compression pour les modèles de réseaux de neurones entraînés.
★ 2 690+7Évolution des étoiles sur les 7 derniers jours - #20
Construisez, personnalisez et contrôlez vos propres LLM. Du prétraitement des données au fine-tuning, xTuring offre un moyen simple de personnaliser des LLM open source.
★ 2 674+0Évolution des étoiles sur les 7 derniers jours - #21
Une liste d'articles, de documents et de codes sur la quantification de modèles. Ce dépôt vise à fournir des informations pour la recherche sur la quantification de modèles et est continuellement amélioré. Les contributions (articles, dépôts) manquantes sont les bienvenues.
★ 2 433+4Évolution des étoiles sur les 7 derniers jours - #22
Maîtriser l'IA appliquée, un concept à la fois.
★ 2 377-1Évolution des étoiles sur les 7 derniers jours - #23
Exécutez des modèles Mixtral-8x7B sur Colab ou des ordinateurs grand public.
★ 2 333+1Évolution des étoiles sur les 7 derniers jours - #24
micronet, une bibliothèque de compression et de déploiement de modèles. Compression : 1. Quantification (QAT, High-Bit, Low-Bit/Ternary/Binary, PTQ 8-bit) ; 2. Élagage (normal, régulier, élagage de canaux de convolution de groupe) ; 3. Groupe.
★ 2 266+0Évolution des étoiles sur les 7 derniers jours - #25
Exécuter un LLM d'un milliard de paramètres sur une carte à 10 $ avec 256 Mo de RAM
★ 1 923+6Évolution des étoiles sur les 7 derniers jours - #26
PPL Quantization Tool (PPQ) est un puissant outil de quantification de réseaux de neurones hors ligne.
★ 1 817+2Évolution des étoiles sur les 7 derniers jours - #27★ 1 682+0Évolution des étoiles sur les 7 derniers jours
- #28
PaddleSlim est une bibliothèque open source pour la compression de modèles profonds et la recherche d'architecture.
★ 1 612+1Évolution des étoiles sur les 7 derniers jours - #29
Un algorithme de quantification SOTA pour l'inférence LLM basse précision haute précision, optimisé pour CPU/XPU/CUDA, avec support multi-type et compatibilité totale avec vLLM, SGLang et Transformers.
★ 1 594+15Évolution des étoiles sur les 7 derniers jours - #30★ 1 579-1Évolution des étoiles sur les 7 derniers jours