Aller au contenu principal
buildradar
Se connecter

thu-ml/SageAttention

@thu-ml

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.

Étoiles
3 699
Bifurcations
498
Langage
Cuda
Licence
Apache-2.0
Dernier push
il y a 8 mois
Cudavideo-generationllmcudaquantizationtritonattentionefficient-attentionvitinference-accelerationmlsysllm-infravideo-generate

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.