跳到主要内容
buildradar
Sign in
主题 · kv-cache

kv-cache

标记 kv-cache 主题、收录中的开源项目,按星标数排序。

项目数
11
总星标数
22,967
平均星标数
2,088
占比
0.00%

常跟 kv-cache 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 kv-cache 主题的项目。

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,197
  • zero-to-sglang@datawhalechina

    面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用

    383
  • LMCache@LMCache

    LMCache:以最快的 KV 缓存层为 LLM 提供加速

    11,622+60近 7 天星标变化
  • godis@HDT3213

    Golang实现的Redis服务器与集群

    3,834+1近 7 天星标变化
  • KVCache-Factory@Zefan-Cai

    用于自回归模型的统一 KV 缓存压缩方法。

    1,376+1近 7 天星标变化
  • kvpress@NVIDIA

    让 LLM KV 缓存压缩变得轻松简单

    1,201+5近 7 天星标变化
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,197+285近 7 天星标变化
  • llm_note@harleyszhang

    LLM 笔记,包含模型推理、Transformer 模型结构,以及 LLM 框架代码分析笔记。

    889+1近 7 天星标变化
  • pegainfer@pegainfer-project

    纯 Rust + CUDA LLM 推理引擎 — 无需 PyTorch,兼容 OpenAI,支持 Qwen3 至 Kimi-K2 服务

    677+14近 7 天星标变化
  • Deepdive-llama3-from-scratch@therealoliver

    逐步实现 llama3 推理、掌握核心概念、掌握过程推导、实现代码。

    630+0近 7 天星标变化
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions:学习用于自适应 Token 层级计算的动态递归深度 (NeurIPS 2025)

    610+23近 7 天星标变化
  • tessera@zengxiao-he

    从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。

    566+30近 7 天星标变化
  • H2O@FMInference

    [NeurIPS'23] H2O:用于大型语言模型高效生成式推理的 Heavy-Hitter Oracle

    532+0近 7 天星标变化
← 返回主题列表