Saltar al contenido principal
buildradar
Iniciar sesión

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention logra una aceleración de 2 a 5 veces en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.

Estrellas
3699
Bifurcaciones
498
Lenguaje
Cuda
Licencia
Apache-2.0
Último push
hace 8 meses
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.