thu-ml/SageAttention
@thu-ml[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention logra una aceleración de 2 a 5 veces en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
Estrellas
3699
Bifurcaciones
498
Lenguaje
Cuda
Licencia
Apache-2.0
Último push
hace 8 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.