paged-attention
Erfasste Open-Source-Repos mit dem Tag paged-attention, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit paged-attention am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit paged-attention getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉
★ 5.482+3Sterne-Änderung der letzten 7 Tage - #2
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 677+14Sterne-Änderung der letzten 7 Tage - #3
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 566+30Sterne-Änderung der letzten 7 Tage