kv-cache
kv-cache टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर kv-cache के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और kv-cache टैग वाली रिपॉजिटरी।
- #1
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,125
- #1★ 11,622+152पिछले 7 दिनों में स्टार का बदलाव
- #2★ 3,834+1पिछले 7 दिनों में स्टार का बदलाव
- #3
ऑटो-रिग्रेसिव मॉडल के लिए एकीकृत KV कैश संपीड़न विधियाँ
★ 1,376+1पिछले 7 दिनों में स्टार का बदलाव - #4★ 1,201+7पिछले 7 दिनों में स्टार का बदलाव
- #5
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,125+317पिछले 7 दिनों में स्टार का बदलाव - #6
LLM नोट्स, जिसमें मॉडल इन्फरेंस, ट्रांसफॉर्मर मॉडल संरचना और LLM फ्रेमवर्क कोड विश्लेषण नोट्स शामिल हैं।
★ 889+1पिछले 7 दिनों में स्टार का बदलाव - #7
Pure Rust + CUDA LLM इन्फरेंस इंजन — कोई PyTorch नहीं, OpenAI-compatible, Qwen3 से Kimi-K2 तक सर्व करता है
★ 671+13पिछले 7 दिनों में स्टार का बदलाव - #8
llama3 इन्फरेंस को चरण-दर-चरण प्राप्त करें, मुख्य अवधारणाओं को समझें, प्रक्रिया व्युत्पत्ति में महारत हासिल करें और कोड लागू करें।
★ 630+0पिछले 7 दिनों में स्टार का बदलाव - #9
Mixture-of-Recursions: एडेप्टिव टोकन-लेवल कंप्यूटेशन के लिए डायनामिक रिकर्सिव डेप्थ सीखना (NeurIPS 2025)
★ 587+2पिछले 7 दिनों में स्टार का बदलाव - #10
शून्य से निर्मित LLM डिस्टिलेशन और सर्विंग इंजन: कस्टम Triton/CUDA कर्नेल, FSDP डिस्टिलेशन, पेज्ड-KV कंटीन्यूअस बैचिंग, सट्टा डिकोडिंग, एक Rust गेटवे, एक JAX ओरेकल और व्याख्यात्मकता उपकरण।
★ 566+46पिछले 7 दिनों में स्टार का बदलाव - #11
[NeurIPS'23] H2O: लार्ज लैंग्वेज मॉडल के कुशल जनरेटिव अनुमान के लिए हेवी-हिट्टर ओरकल
★ 532+0पिछले 7 दिनों में स्टार का बदलाव