跳到主要內容
buildradar
Sign in
主題 · kv-cache

kv-cache

標記 kv-cache 主題、收錄中的開源專案,依星數排序。

專案數
11
總星數
22,967
平均星數
2,088
佔比
0.00%

常跟 kv-cache 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 kv-cache 主題的專案。

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,185
  • LMCache@LMCache

    LMCache:以最快的 KV 快取層為 LLM 提供加速

    11,622+60近 7 天星數變化
  • godis@HDT3213

    Golang實作的Redis伺服器與叢集

    3,834+1近 7 天星數變化
  • KVCache-Factory@Zefan-Cai

    用於自迴歸模型的統一 KV 快取壓縮方法。

    1,376+1近 7 天星數變化
  • kvpress@NVIDIA

    讓 LLM KV 快取壓縮變得輕鬆簡單

    1,201+5近 7 天星數變化
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,185+285近 7 天星數變化
  • llm_note@harleyszhang

    LLM 筆記,包含模型推論、Transformer 模型結構,以及 LLM 框架程式碼分析筆記。

    889+1近 7 天星數變化
  • pegainfer@pegainfer-project

    純 Rust + CUDA LLM 推論引擎 — 無需 PyTorch,相容 OpenAI,支援 Qwen3 至 Kimi-K2 服務

    677+14近 7 天星數變化
  • Deepdive-llama3-from-scratch@therealoliver

    逐步實現 llama3 推論、掌握核心概念、掌握過程推導、實作程式碼。

    630+0近 7 天星數變化
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions:學習用於自適應 Token 層級計算的動態遞迴深度 (NeurIPS 2025)

    610+23近 7 天星數變化
  • tessera@zengxiao-he

    從教師模型到模型切片——從零開始的 LLM 蒸餾與服務引擎:包含自訂 Triton/CUDA 核心、FSDP 蒸餾、paged-KV 連續批次處理、推測解碼、Rust 閘道、JAX 預測器與可解釋性工具。

    566+30近 7 天星數變化
  • H2O@FMInference

    [NeurIPS'23] H2O:用於大型語言模型高效生成式推論的 Heavy-Hitter Oracle

    532+0近 7 天星數變化
← 返回主題列表