kv-cache
标记 kv-cache 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 kv-cache 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 kv-cache 主题的项目。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,197 - #2
面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用
★ 383
- #1★ 11,622+60近 7 天星标变化
- #2★ 3,834+1近 7 天星标变化
- #3
用于自回归模型的统一 KV 缓存压缩方法。
★ 1,376+1近 7 天星标变化 - #4★ 1,201+5近 7 天星标变化
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,197+285近 7 天星标变化 - #6★ 889+1近 7 天星标变化
- #7★ 677+14近 7 天星标变化
- #8
逐步实现 llama3 推理、掌握核心概念、掌握过程推导、实现代码。
★ 630+0近 7 天星标变化 - #9
Mixture-of-Recursions:学习用于自适应 Token 层级计算的动态递归深度 (NeurIPS 2025)
★ 610+23近 7 天星标变化 - #10
从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。
★ 566+30近 7 天星标变化 - #11★ 532+0近 7 天星标变化