Aller au contenu principal
buildradar
Sign in
Sujet · quantization

quantization

Dépôts open source suivis étiquetés quantization, triés par étoiles.

Dépôts
62
Total d'étoiles
264 169
Étoiles en moyenne
4 261
Part
0,01%

Sujets qui apparaissent souvent aux côtés de quantization sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés quantization.

  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.

    6 910
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    962
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    552
  • LlamaFactory@hiyouga

    Fine-tuning efficace et unifié de plus de 100 LLM et VLM (ACL 2024).

    74 443+158Évolution des étoiles sur les 7 derniers jours
  • faster-whisper@SYSTRAN

    Transcription Faster Whisper optimisée avec CTranslate2

    25 135+108Évolution des étoiles sur les 7 derniers jours
  • Modèles de langage chinois LLaMA & Alpaca avec entraînement et déploiement local sur CPU/GPU.

    18 934+2Évolution des étoiles sur les 7 derniers jours
  • Qbot@UFund-Me

    [🔥en cours de mise à jour...] Robot de trading quantitatif automatisé par IA (déploiement entièrement local). Plateforme de recherche en investissement quantitatif basée sur l'IA. 📃 documentation en ligne : https://ufund-me.github.io/Qbot ✨ :news: qbot-mini : https://github.com/Charmve/iQuant

    18 418+46Évolution des étoiles sur les 7 derniers jours
  • turbovec@RyanCodrai

    Un index vectoriel basé sur TurboQuant, écrit en Rust avec des liaisons Python.

    16 518+308Évolution des étoiles sur les 7 derniers jours
  • bitsandbytes@bitsandbytes-foundation

    Grands modèles de langage accessibles via quantification k-bit pour PyTorch.

    8 446+16Évolution des étoiles sur les 7 derniers jours
  • kimi-k3-in-c@FareedKhan-dev

    Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.

    6 910+485Évolution des étoiles sur les 7 derniers jours
  • pngquant@kornelski

    Compresseur PNG avec perte — commande pngquant basée sur la bibliothèque libimagequant

    5 744+4Évolution des étoiles sur les 7 derniers jours
  • CTranslate2@OpenNMT

    Moteur d'inférence rapide pour les modèles Transformer

    4 651+23Évolution des étoiles sur les 7 derniers jours
  • nunchaku@nunchaku-ai

    [ICLR2025 Spotlight] SVDQuant : absorption des valeurs aberrantes par des composants de bas rang pour les modèles de diffusion 4 bits.

    3 937+1Évolution des étoiles sur les 7 derniers jours
  • llm-compressor@vllm-project

    Bibliothèque compatible avec Transformers pour appliquer divers algorithmes de compression aux LLM, optimisant ainsi leur déploiement avec vLLM.

    3 736+27Évolution des étoiles sur les 7 derniers jours
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.

    3 685+23Évolution des étoiles sur les 7 derniers jours
  • optimum@huggingface

    Accélérez l'inférence et l'entraînement de 🤗 Transformers, Diffusers, TIMM et Sentence Transformers avec des outils d'optimisation matérielle simples d'utilisation.

    3 473+9Évolution des étoiles sur les 7 derniers jours
  • Modèle de langage pré-entraîné et ses techniques d'optimisation associées développés par le Huawei Noah's Ark Lab.

    3 166+1Évolution des étoiles sur les 7 derniers jours
  • ao@pytorch

    Quantification native PyTorch pour l'entraînement et l'inférence

    2 959+7Évolution des étoiles sur les 7 derniers jours
  • ComfyUI-nunchaku@nunchaku-ai

    Plugin ComfyUI pour Nunchaku.

    2 920+2Évolution des étoiles sur les 7 derniers jours
  • ai-engineering-interview-questions@amitshekhariitbhu

    Votre aide-mémoire pour les entretiens en ingénierie IA : questions et réponses.

    2 888+112Évolution des étoiles sur les 7 derniers jours
  • Quantification LLM faible bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) et sparsité ; techniques de compression de modèles de pointe pour PyTorch, TensorFlow et ONNX Runtime.

    2 706+5Évolution des étoiles sur les 7 derniers jours
  • aimet@qualcomm

    AIMET est une bibliothèque fournissant des techniques avancées de quantification et de compression pour les modèles de réseaux de neurones entraînés.

    2 690+7Évolution des étoiles sur les 7 derniers jours
  • xTuring@stochasticai

    Construisez, personnalisez et contrôlez vos propres LLM. Du prétraitement des données au fine-tuning, xTuring offre un moyen simple de personnaliser des LLM open source.

    2 674+0Évolution des étoiles sur les 7 derniers jours
  • Une liste d'articles, de documents et de codes sur la quantification de modèles. Ce dépôt vise à fournir des informations pour la recherche sur la quantification de modèles et est continuellement amélioré. Les contributions (articles, dépôts) manquantes sont les bienvenues.

    2 433+4Évolution des étoiles sur les 7 derniers jours
  • AI-Engineering.academy@adithya-s-k

    Maîtriser l'IA appliquée, un concept à la fois.

    2 377-1Évolution des étoiles sur les 7 derniers jours
  • mixtral-offloading@dvmazur

    Exécutez des modèles Mixtral-8x7B sur Colab ou des ordinateurs grand public.

    2 333+1Évolution des étoiles sur les 7 derniers jours
  • micronet@666DZY666

    micronet, une bibliothèque de compression et de déploiement de modèles. Compression : 1. Quantification (QAT, High-Bit, Low-Bit/Ternary/Binary, PTQ 8-bit) ; 2. Élagage (normal, régulier, élagage de canaux de convolution de groupe) ; 3. Groupe.

    2 266+0Évolution des étoiles sur les 7 derniers jours
  • picolm@RightNow-AI

    Exécuter un LLM d'un milliard de paramètres sur une carte à 10 $ avec 256 Mo de RAM

    1 923+6Évolution des étoiles sur les 7 derniers jours
  • ppq@OpenPPL

    PPL Quantization Tool (PPQ) est un puissant outil de quantification de réseaux de neurones hors ligne.

    1 817+2Évolution des étoiles sur les 7 derniers jours
  • mmrazor@open-mmlab

    Boîte à outils et benchmark de compression de modèles OpenMMLab.

    1 682+0Évolution des étoiles sur les 7 derniers jours
  • PaddleSlim@PaddlePaddle

    PaddleSlim est une bibliothèque open source pour la compression de modèles profonds et la recherche d'architecture.

    1 612+1Évolution des étoiles sur les 7 derniers jours
  • auto-round@intel

    Un algorithme de quantification SOTA pour l'inférence LLM basse précision haute précision, optimisé pour CPU/XPU/CUDA, avec support multi-type et compatibilité totale avec vLLM, SGLang et Transformers.

    1 594+15Évolution des étoiles sur les 7 derniers jours
  • rwkv.cpp@RWKV

    Inférence INT4/INT5/INT8 et FP16 sur CPU pour le modèle de langage RWKV.

    1 579-1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets