Zum Hauptinhalt springen
buildradar
Anmelden

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention erzielt eine 2- bis 5-fache Beschleunigung im Vergleich zu FlashAttention, ohne Einbußen bei End-to-End-Metriken über Sprach-, Bild- und Videomodelle hinweg.

Sterne
3.699
Forks
498
Sprache
Cuda
Lizenz
Apache-2.0
Letzter Push
vor 8 Monaten
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.