kv-cache
標記 kv-cache 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 kv-cache 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 kv-cache 主題的專案。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,185
- #1★ 11,622+60近 7 天星數變化
- #2★ 3,834+1近 7 天星數變化
- #3
用於自迴歸模型的統一 KV 快取壓縮方法。
★ 1,376+1近 7 天星數變化 - #4★ 1,201+5近 7 天星數變化
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,185+285近 7 天星數變化 - #6★ 889+1近 7 天星數變化
- #7★ 677+14近 7 天星數變化
- #8
逐步實現 llama3 推論、掌握核心概念、掌握過程推導、實作程式碼。
★ 630+0近 7 天星數變化 - #9
Mixture-of-Recursions:學習用於自適應 Token 層級計算的動態遞迴深度 (NeurIPS 2025)
★ 610+23近 7 天星數變化 - #10
從教師模型到模型切片——從零開始的 LLM 蒸餾與服務引擎:包含自訂 Triton/CUDA 核心、FSDP 蒸餾、paged-KV 連續批次處理、推測解碼、Rust 閘道、JAX 預測器與可解釋性工具。
★ 566+30近 7 天星數變化 - #11★ 532+0近 7 天星數變化