Pular para o conteúdo principal
buildradar
Entrar

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] O Quantized Attention alcança uma aceleração de 2 a 5 vezes em comparação ao FlashAttention, sem perda de métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.

Estrelas
3.699
Bifurcações
498
Linguagem
Cuda
Licença
Apache-2.0
Último push
há 8 meses
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.