跳到主要内容
buildradar
登录

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention 在速度上比 FlashAttention 提升 2-5 倍,且不损失语言、影像与影片模型的端到端指标

星数
3,722
Fork 数
505
语言
Cuda
许可
Apache-2.0
最后推送
8个月前
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

还没有相关情报

radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。