quantization
quantization टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31★ 1,579+0पिछले 7 दिनों में स्टार का बदलाव
- #32
Keras और TensorFlow के लिए डिप्लॉयमेंट हेतु ML मॉडल को अनुकूलित करने वाला टूलकिट, जिसमें क्वांटाइजेशन और प्रूनिंग शामिल है।
★ 1,578+0पिछले 7 दिनों में स्टार का बदलाव - #33★ 1,568+1पिछले 7 दिनों में स्टार का बदलाव
- #34
किसी भी LLM के लिए token/s और GPU मेमोरी आवश्यकता की गणना करें। llama.cpp/ggml/bnb/QLoRA क्वांटाइजेशन का समर्थन करता है
★ 1,406+0पिछले 7 दिनों में स्टार का बदलाव - #35★ 1,325+5पिछले 7 दिनों में स्टार का बदलाव
- #36
Huawei Noah's Ark Lab द्वारा विकसित कुशल कंप्यूटिंग विधियाँ
★ 1,307+0पिछले 7 दिनों में स्टार का बदलाव - #37
Nvidia, AMD, Intel GPU और Intel/AMD/Apple CPU के लिए HF, vLLM और SGLang के माध्यम से HW एक्सीलरेशन समर्थन के साथ LLM मॉडल क्वांटाइजेशन (कंप्रेशन) टूलकिट।
★ 1,248+0पिछले 7 दिनों में स्टार का बदलाव - #38★ 1,197+4पिछले 7 दिनों में स्टार का बदलाव
- #39
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,191+285पिछले 7 दिनों में स्टार का बदलाव - #40
FP16xINT4 LLM इंफरेंस कर्नेल जो 16-32 टोकन के मध्यम बैच आकार तक लगभग-आदर्श ~4x स्पीडअप प्राप्त कर सकता है।
★ 1,138+2पिछले 7 दिनों में स्टार का बदलाव - #41
Z80-μLM एक 2-बिट क्वांटाइज्ड लैंग्वेज मॉडल है जो 8-बिट Z80 प्रोसेसर पर चलने के लिए काफी छोटा है। Python में संवादात्मक मॉडल प्रशिक्षित करें, उन्हें CP/M .COM बाइनरी के रूप में निर्यात करें, और अपने पुराने कंप्यूटर के साथ चैट करें।
★ 1,119+2पिछले 7 दिनों में स्टार का बदलाव - #42★ 1,053+4पिछले 7 दिनों में स्टार का बदलाव
- #43
optimum के लिए एक pytorch क्वांटाइजेशन बैकएंड।
★ 1,053-1पिछले 7 दिनों में स्टार का बदलाव - #44
[ICML2025] SpargeAttention: एक ट्रेनिंग-मुक्त स्पार्स अटेंशन जो किसी भी मॉडल के इन्फॉरेंस को गति देता है।
★ 1,045+1पिछले 7 दिनों में स्टार का बदलाव - #45
ONNX फ़ाइलों को LiteRT/TFLite/TensorFlow, PyTorch नेटिव कोड (nn.Module), TorchScript (.pt), state_dict (.pt), Exported Program (.pt2), और Dynamo ONNX में बदलने के लिए एक टूल। यह LiteRT से PyTorch में सीधे रूपांतरण का भी समर्थन करता है।
★ 993+2पिछले 7 दिनों में स्टार का बदलाव - #46
TinyChatEngine: ऑन-डिवाइस LLM इन्फेरेंस लाइब्रेरी
★ 961+0पिछले 7 दिनों में स्टार का बदलाव - #47★ 958+3पिछले 7 दिनों में स्टार का बदलाव
- #48
[NeurIPS 2020] MCUNet: IoT डिवाइस पर टाइनी डीप लर्निंग; [NeurIPS 2021] MCUNetV2: टाइनी डीप लर्निंग के लिए मेमोरी-कुशल पैच-आधारित इन्फरेंस; [NeurIPS 2022] MCUNetV3: 256KB मेमोरी के तहत ऑन-डिवाइस ट्रेनिंग
★ 957+3पिछले 7 दिनों में स्टार का बदलाव - #49
पैलेट क्वांटिज़ेशन लाइब्रेरी जो pngquant और अन्य PNG ऑप्टिमाइज़र को पावर देती है
★ 931+1पिछले 7 दिनों में स्टार का बदलाव - #50
[ICLR2024 spotlight] OmniQuant LLMs के लिए एक सरल और शक्तिशाली क्वांटाइजेशन तकनीक है।
★ 919+8पिछले 7 दिनों में स्टार का बदलाव - #51
हालिया AI सम्मेलनों और पत्रिकाओं में न्यूरल नेटवर्क क्वांटाइजेशन से संबंधित शोध पत्रों की सूची।
★ 851+6पिछले 7 दिनों में स्टार का बदलाव - #52
[EMNLP 2024 & AAAI 2026] LLMs, VLMs और वीडियो जेनरेटिव मॉडल सहित बड़े मॉडलों को कंप्रेस करने के लिए एक शक्तिशाली टूलकिट।
★ 747+4पिछले 7 दिनों में स्टार का बदलाव - #53
[ICML 2024] SqueezeLLM: डेंस-एंड-स्पार्स क्वांटाइजेशन।
★ 724+1पिछले 7 दिनों में स्टार का बदलाव - #54
Hailo Model Zoo में प्री-ट्रेंड मॉडल और एक पूर्ण बिल्डिंग और इवैल्यूएशन एनवायरनमेंट शामिल है
★ 704+2पिछले 7 दिनों में स्टार का बदलाव - #55
SINQ की आधिकारिक रिपॉजिटरी में आपका स्वागत है! एक नई, तेज़ और उच्च-गुणवत्ता वाली क्वांटिज़ेशन विधि जिसे किसी भी Large Language Model को सटीकता बनाए रखते हुए छोटा करने के लिए डिज़ाइन किया गया है [ICML 2026]।
★ 630+1पिछले 7 दिनों में स्टार का बदलाव - #56★ 608+42पिछले 7 दिनों में स्टार का बदलाव
- #57
Android पर ऑफ़लाइन सेमेंटिक टेक्स्ट-टू-इमेज और इमेज-टू-इमेज सर्च, जो क्वांटाइज़्ड अत्याधुनिक विज़न-लैंग्वेज प्रीट्रेन्ड CLIP मॉडल और ONNX रनटाइम इन्फरेंस इंजन द्वारा संचालित है।
★ 599+1पिछले 7 दिनों में स्टार का बदलाव - #58★ 584+0पिछले 7 दिनों में स्टार का बदलाव
- #59
onnx->keras या onnx->tflite के लिए टूल। आशा है कि यह टूल आपकी मदद करेगा।
★ 579+0पिछले 7 दिनों में स्टार का बदलाव - #60
शून्य से निर्मित LLM डिस्टिलेशन और सर्विंग इंजन: कस्टम Triton/CUDA कर्नेल, FSDP डिस्टिलेशन, पेज्ड-KV कंटीन्यूअस बैचिंग, सट्टा डिकोडिंग, एक Rust गेटवे, एक JAX ओरेकल और व्याख्यात्मकता उपकरण।
★ 566+30पिछले 7 दिनों में स्टार का बदलाव