मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · quantization

quantization

quantization टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

62 रिपॉजिटरी
  • rwkv.cpp@RWKV

    RWKV भाषा मॉडल के लिए CPU पर INT4/INT5/INT8 और FP16 इनफेरेंस।

    1,579+0पिछले 7 दिनों में स्टार का बदलाव
  • model-optimization@tensorflow

    Keras और TensorFlow के लिए डिप्लॉयमेंट हेतु ML मॉडल को अनुकूलित करने वाला टूलकिट, जिसमें क्वांटाइजेशन और प्रूनिंग शामिल है।

    1,578+0पिछले 7 दिनों में स्टार का बदलाव
  • brevitas@Xilinx

    Brevitas: PyTorch में न्यूरल नेटवर्क क्वांटाइजेशन

    1,568+1पिछले 7 दिनों में स्टार का बदलाव
  • gpu_poor@RahulSChand

    किसी भी LLM के लिए token/s और GPU मेमोरी आवश्यकता की गणना करें। llama.cpp/ggml/bnb/QLoRA क्वांटाइजेशन का समर्थन करता है

    1,406+0पिछले 7 दिनों में स्टार का बदलाव
  • geti@open-edge-platform

    बहुत कम समय में और कम डेटा के साथ computer vision मॉडल बनाएं।

    1,325+5पिछले 7 दिनों में स्टार का बदलाव
  • Efficient-Computing@huawei-noah

    Huawei Noah's Ark Lab द्वारा विकसित कुशल कंप्यूटिंग विधियाँ

    1,307+0पिछले 7 दिनों में स्टार का बदलाव
  • GPTQModel@ModelCloud

    Nvidia, AMD, Intel GPU और Intel/AMD/Apple CPU के लिए HF, vLLM और SGLang के माध्यम से HW एक्सीलरेशन समर्थन के साथ LLM मॉडल क्वांटाइजेशन (कंप्रेशन) टूलकिट।

    1,248+0पिछले 7 दिनों में स्टार का बदलाव
  • nncf@openvinotoolkit

    बेहतर OpenVINO™ inference के लिए Neural Network Compression Framework

    1,197+4पिछले 7 दिनों में स्टार का बदलाव
  • vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क

    1,191+285पिछले 7 दिनों में स्टार का बदलाव
  • marlin@IST-DASLab

    FP16xINT4 LLM इंफरेंस कर्नेल जो 16-32 टोकन के मध्यम बैच आकार तक लगभग-आदर्श ~4x स्पीडअप प्राप्त कर सकता है।

    1,138+2पिछले 7 दिनों में स्टार का बदलाव
  • z80ai@HarryR

    Z80-μLM एक 2-बिट क्वांटाइज्ड लैंग्वेज मॉडल है जो 8-बिट Z80 प्रोसेसर पर चलने के लिए काफी छोटा है। Python में संवादात्मक मॉडल प्रशिक्षित करें, उन्हें CP/M .COM बाइनरी के रूप में निर्यात करें, और अपने पुराने कंप्यूटर के साथ चैट करें।

    1,119+2पिछले 7 दिनों में स्टार का बदलाव
  • finn@Xilinx

    FPGAs पर QNN इन्फरेंस के लिए डेटाफ्लो कंपाइलर

    1,053+4पिछले 7 दिनों में स्टार का बदलाव
  • optimum-quanto@huggingface

    optimum के लिए एक pytorch क्वांटाइजेशन बैकएंड।

    1,053-1पिछले 7 दिनों में स्टार का बदलाव
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: एक ट्रेनिंग-मुक्त स्पार्स अटेंशन जो किसी भी मॉडल के इन्फॉरेंस को गति देता है।

    1,045+1पिछले 7 दिनों में स्टार का बदलाव
  • onnx2tf@PINTO0309

    ONNX फ़ाइलों को LiteRT/TFLite/TensorFlow, PyTorch नेटिव कोड (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2), और Dynamo ONNX में बदलने के लिए एक टूल। यह LiteRT से PyTorch में सीधे रूपांतरण का भी समर्थन करता है।

    993+2पिछले 7 दिनों में स्टार का बदलाव
  • TinyChatEngine@mit-han-lab

    TinyChatEngine: ऑन-डिवाइस LLM इन्फेरेंस लाइब्रेरी

    961+0पिछले 7 दिनों में स्टार का बदलाव
  • hqq@dropbox

    Half-Quadratic Quantization (HQQ) का आधिकारिक कार्यान्वयन

    958+3पिछले 7 दिनों में स्टार का बदलाव
  • tinyengine@mit-han-lab

    [NeurIPS 2020] MCUNet: IoT डिवाइस पर टाइनी डीप लर्निंग; [NeurIPS 2021] MCUNetV2: टाइनी डीप लर्निंग के लिए मेमोरी-कुशल पैच-आधारित इन्फरेंस; [NeurIPS 2022] MCUNetV3: 256KB मेमोरी के तहत ऑन-डिवाइस ट्रेनिंग

    957+3पिछले 7 दिनों में स्टार का बदलाव
  • libimagequant@ImageOptim

    पैलेट क्वांटिज़ेशन लाइब्रेरी जो pngquant और अन्य PNG ऑप्टिमाइज़र को पावर देती है

    931+1पिछले 7 दिनों में स्टार का बदलाव
  • OmniQuant@OpenGVLab

    [ICLR2024 spotlight] OmniQuant LLMs के लिए एक सरल और शक्तिशाली क्वांटाइजेशन तकनीक है।

    919+8पिछले 7 दिनों में स्टार का बदलाव
  • हालिया AI सम्मेलनों और पत्रिकाओं में न्यूरल नेटवर्क क्वांटाइजेशन से संबंधित शोध पत्रों की सूची।

    851+6पिछले 7 दिनों में स्टार का बदलाव
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLMs, VLMs और वीडियो जेनरेटिव मॉडल सहित बड़े मॉडलों को कंप्रेस करने के लिए एक शक्तिशाली टूलकिट।

    747+4पिछले 7 दिनों में स्टार का बदलाव
  • SqueezeLLM@SqueezeAILab

    [ICML 2024] SqueezeLLM: डेंस-एंड-स्पार्स क्वांटाइजेशन।

    724+1पिछले 7 दिनों में स्टार का बदलाव
  • hailo_model_zoo@hailo-ai

    Hailo Model Zoo में प्री-ट्रेंड मॉडल और एक पूर्ण बिल्डिंग और इवैल्यूएशन एनवायरनमेंट शामिल है

    704+2पिछले 7 दिनों में स्टार का बदलाव
  • SINQ@huawei-csl

    SINQ की आधिकारिक रिपॉजिटरी में आपका स्वागत है! एक नई, तेज़ और उच्च-गुणवत्ता वाली क्वांटिज़ेशन विधि जिसे किसी भी Large Language Model को सटीकता बनाए रखते हुए छोटा करने के लिए डिज़ाइन किया गया है [ICML 2026]।

    630+1पिछले 7 दिनों में स्टार का बदलाव
  • hipfire@warpfront

    Rust में RDNA-नेटिव LLM इन्फरेंस इंजन

    608+42पिछले 7 दिनों में स्टार का बदलाव
  • tidy@slavabarkov

    Android पर ऑफ़लाइन सेमेंटिक टेक्स्ट-टू-इमेज और इमेज-टू-इमेज सर्च, जो क्वांटाइज़्ड अत्याधुनिक विज़न-लैंग्वेज प्रीट्रेन्ड CLIP मॉडल और ONNX रनटाइम इन्फरेंस इंजन द्वारा संचालित है।

    599+1पिछले 7 दिनों में स्टार का बदलाव
  • qkeras@google

    QKeras: Tensorflow Keras के लिए एक क्वांटाइजेशन डीप लर्निंग लाइब्रेरी

    584+0पिछले 7 दिनों में स्टार का बदलाव
  • onnx2tflite@MPolaris

    onnx->keras या onnx->tflite के लिए टूल। आशा है कि यह टूल आपकी मदद करेगा।

    579+0पिछले 7 दिनों में स्टार का बदलाव
  • tessera@zengxiao-he

    शून्य से निर्मित LLM डिस्टिलेशन और सर्विंग इंजन: कस्टम Triton/CUDA कर्नेल, FSDP डिस्टिलेशन, पेज्ड-KV कंटीन्यूअस बैचिंग, सट्टा डिकोडिंग, एक Rust गेटवे, एक JAX ओरेकल और व्याख्यात्मकता उपकरण।

    566+30पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस