thu-ml/SageAttention
@thu-ml[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention đạt tốc độ xử lý nhanh hơn 2-5 lần so với FlashAttention, mà không làm giảm các chỉ số tổng thể trên các mô hình ngôn ngữ, hình ảnh và video.
Sao
3.699
Fork
498
Ngôn ngữ
Cuda
Giấy phép
Apache-2.0
Push gần nhất
8 tháng trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.