paged-attention
Dépôts open source suivis étiquetés paged-attention, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de paged-attention sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés paged-attention.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Liste organisée d'articles de recherche sur l'inférence LLM/VLM avec code : Flash-Attention, Paged-Attention, WINT8/4, parallélisme, etc.
★ 5 482+3Évolution des étoiles sur les 7 derniers jours - #2
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 677+18Évolution des étoiles sur les 7 derniers jours - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Évolution des étoiles sur les 7 derniers jours