paged-attention
Repositórios de código aberto acompanhados marcados com paged-attention, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de paged-attention no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com paged-attention.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
📚 Uma lista curada de artigos incríveis sobre inferência de LLM/VLM com código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉
★ 5.482+3Variação de estrelas nos últimos 7 dias - #2
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 677+14Variação de estrelas nos últimos 7 dias - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Variação de estrelas nos últimos 7 dias