thu-ml/SageAttention
@thu-ml[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention भाषा, छवि और वीडियो मॉडल में एंड-टू-एंड मेट्रिक्स खोए बिना FlashAttention की तुलना में 2-5x गति प्राप्त करता है।
स्टार
3,699
फ़ोर्क
498
भाषा
Cuda
लाइसेंस
Apache-2.0
आख़िरी push
8 माह पहले
संबंधित intel (0)
अभी कोई संबंधित intel नहीं
यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।