跳到主要內容
buildradar
登入

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention 在速度上比 FlashAttention 提升 2-5 倍,且不損失語言、影像與影片模型的端到端指標

星數
3,722
Fork 數
505
語言
Cuda
授權
Apache-2.0
最後推送
8 個月前
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。