kv-cache
kv-cache 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 kv-cache 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 kv-cache 태그가 달린 리포지토리예요.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,129
- #1★ 11,622+152최근 7일 스타 변화
- #2★ 3,834+1최근 7일 스타 변화
- #3
자기회귀 모델을 위한 통합 KV 캐시 압축 방법
★ 1,376+1최근 7일 스타 변화 - #4★ 1,201+7최근 7일 스타 변화
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,129+317최근 7일 스타 변화 - #6★ 889+1최근 7일 스타 변화
- #7
Pure Rust + CUDA LLM 추론 엔진 — PyTorch 미사용, OpenAI 호환, Qwen3에서 Kimi-K2까지 서비스 제공
★ 671+13최근 7일 스타 변화 - #8
llama3 추론 과정을 단계별로 학습하고 핵심 개념 파악, 프로세스 유도 및 코드 구현
★ 630+0최근 7일 스타 변화 - #9
Mixture-of-Recursions: 적응형 토큰 수준 계산을 위한 동적 재귀 깊이 학습 (NeurIPS 2025)
★ 587+2최근 7일 스타 변화 - #10
교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.
★ 566+46최근 7일 스타 변화 - #11★ 532+0최근 7일 스타 변화