kv-cache
Repositórios de código aberto acompanhados marcados com kv-cache, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de kv-cache no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com kv-cache.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.125
- #1★ 11.622+152Variação de estrelas nos últimos 7 dias
- #2★ 3.834+1Variação de estrelas nos últimos 7 dias
- #3
Métodos unificados de compressão de cache KV para modelos autorregressivos.
★ 1.376+1Variação de estrelas nos últimos 7 dias - #4★ 1.201+7Variação de estrelas nos últimos 7 dias
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.125+317Variação de estrelas nos últimos 7 dias - #6
Notas sobre LLM, incluindo inferência de modelos, estrutura de modelos transformer e notas de análise de código de frameworks de LLM.
★ 889+1Variação de estrelas nos últimos 7 dias - #7
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 671+13Variação de estrelas nos últimos 7 dias - #8
Implemente a inferência do llama3 passo a passo, compreenda os conceitos centrais, domine a derivação do processo e escreva o código.
★ 630+0Variação de estrelas nos últimos 7 dias - #9
Mixture-of-Recursions: Aprendendo Profundidades Recursivas Dinâmicas para Computação Adaptativa em Nível de Token (NeurIPS 2025)
★ 587+2Variação de estrelas nos últimos 7 dias - #10
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+46Variação de estrelas nos últimos 7 dias - #11
[NeurIPS'23] H2O: Heavy-Hitter Oracle para Inferência Gerativa Eficiente de Modelos de Linguagem de Grande Porte.
★ 532+0Variação de estrelas nos últimos 7 dias