मुख्य सामग्री पर जाएँ
buildradar
साइन इन करें

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention भाषा, छवि और वीडियो मॉडल में एंड-टू-एंड मेट्रिक्स खोए बिना FlashAttention की तुलना में 2-5x गति प्राप्त करता है।

स्टार
3,699
फ़ोर्क
498
भाषा
Cuda
लाइसेंस
Apache-2.0
आख़िरी push
8 माह पहले
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।