thu-ml/SageAttention
@thu-ml[ICLR2025, ICML2025, NeurIPS2025 Spotlight] O Quantized Attention alcança uma aceleração de 2 a 5 vezes em comparação ao FlashAttention, sem perda de métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.
Estrelas
3.699
Bifurcações
498
Linguagem
Cuda
Licença
Apache-2.0
Último push
há 8 meses
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.