Pular para o conteúdo principal
buildradar
Sign in
Tópico · kv-cache

kv-cache

Repositórios de código aberto acompanhados marcados com kv-cache, ordenados por estrelas.

Repositórios
11
Total de estrelas
22.967
Média de estrelas
2.088
Participação
0,00%

Tópicos que aparecem com frequência ao lado de kv-cache no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com kv-cache.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.125
  • LMCache@LMCache

    LMCache: Potencialize seu LLM com a camada de cache KV mais rápida

    11.622+152Variação de estrelas nos últimos 7 dias
  • godis@HDT3213

    Um servidor Redis e cluster implementado em Golang.

    3.834+1Variação de estrelas nos últimos 7 dias
  • KVCache-Factory@Zefan-Cai

    Métodos unificados de compressão de cache KV para modelos autorregressivos.

    1.376+1Variação de estrelas nos últimos 7 dias
  • kvpress@NVIDIA

    Compressão de cache KV para LLM simplificada

    1.201+7Variação de estrelas nos últimos 7 dias
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.125+317Variação de estrelas nos últimos 7 dias
  • llm_note@harleyszhang

    Notas sobre LLM, incluindo inferência de modelos, estrutura de modelos transformer e notas de análise de código de frameworks de LLM.

    889+1Variação de estrelas nos últimos 7 dias
  • pegainfer@pegainfer-project

    Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2

    671+13Variação de estrelas nos últimos 7 dias
  • Deepdive-llama3-from-scratch@therealoliver

    Implemente a inferência do llama3 passo a passo, compreenda os conceitos centrais, domine a derivação do processo e escreva o código.

    630+0Variação de estrelas nos últimos 7 dias
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions: Aprendendo Profundidades Recursivas Dinâmicas para Computação Adaptativa em Nível de Token (NeurIPS 2025)

    587+2Variação de estrelas nos últimos 7 dias
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+46Variação de estrelas nos últimos 7 dias
  • H2O@FMInference

    [NeurIPS'23] H2O: Heavy-Hitter Oracle para Inferência Gerativa Eficiente de Modelos de Linguagem de Grande Porte.

    532+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos