microsoft/MInference
@microsoft[NeurIPS'24 Spotlight, ICLR'25, ICML'25] लंबे संदर्भ वाले LLM के अनुमान को तेज़ करने के लिए, अनुमान विलंबता को 10x तक कम करते हुए ध्यान की गणना को अनुमानित और गतिशील रूप से विरल करता है।
स्टार
1,226
फ़ोर्क
80
भाषा
Python
लाइसेंस
MIT
आख़िरी push
5 माह पहले
संबंधित intel (0)
अभी कोई संबंधित intel नहीं
यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।