thu-ml/SageAttention
@thu-ml[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention erzielt eine 2- bis 5-fache Beschleunigung im Vergleich zu FlashAttention, ohne Einbußen bei End-to-End-Metriken über Sprach-, Bild- und Videomodelle hinweg.
Sterne
3.699
Forks
498
Sprache
Cuda
Lizenz
Apache-2.0
Letzter Push
vor 8 Monaten
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.