inference-acceleration
Dépôts open source suivis étiquetés inference-acceleration, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de inference-acceleration sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés inference-acceleration.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.
★ 3 699+14Évolution des étoiles sur les 7 derniers jours - #2
TurboDiffusion : accélération de 100 à 200 fois pour les modèles de diffusion vidéo.
★ 3 634+6Évolution des étoiles sur les 7 derniers jours - #3
Timestep Embedding Tells : Il est temps de mettre en cache pour le modèle de diffusion vidéo.
★ 1 371+2Évolution des étoiles sur les 7 derniers jours - #4
[ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.
★ 1 043+1Évolution des étoiles sur les 7 derniers jours