Saltar al contenido principal
buildradar
Sign in
Tema · kv-cache

kv-cache

Repositorios de código abierto monitorizados etiquetados con kv-cache, ordenados por estrellas.

Repositorios
11
Estrellas totales
22.967
Estrellas de media
2088
Proporción
0,00%

Temas que aparecen con frecuencia junto a kv-cache en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con kv-cache.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1109
  • LMCache@LMCache

    LMCache: Potencia tu LLM con la capa de caché KV más rápida

    11.622+152Variación de estrellas de los últimos 7 días
  • godis@HDT3213

    Un servidor y clúster de Redis implementado en Golang.

    3834+1Variación de estrellas de los últimos 7 días
  • KVCache-Factory@Zefan-Cai

    Métodos unificados de compresión de caché KV para modelos autorregresivos.

    1376+1Variación de estrellas de los últimos 7 días
  • kvpress@NVIDIA

    Compresión de caché KV para LLM simplificada

    1201+7Variación de estrellas de los últimos 7 días
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1109+317Variación de estrellas de los últimos 7 días
  • llm_note@harleyszhang

    Notas sobre LLM, incluyendo inferencia de modelos, estructura de modelos transformer y análisis de código de frameworks de LLM.

    889+1Variación de estrellas de los últimos 7 días
  • pegainfer@pegainfer-project

    Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2

    670+13Variación de estrellas de los últimos 7 días
  • Deepdive-llama3-from-scratch@therealoliver

    Realice la inferencia de llama3 paso a paso, comprenda los conceptos básicos, domine la derivación del proceso e implemente el código.

    630+0Variación de estrellas de los últimos 7 días
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions: Aprendizaje de profundidades recursivas dinámicas para computación adaptativa a nivel de token (NeurIPS 2025)

    583+2Variación de estrellas de los últimos 7 días
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    566+46Variación de estrellas de los últimos 7 días
  • H2O@FMInference

    [NeurIPS'23] H2O: Heavy-Hitter Oracle para la inferencia generativa eficiente de modelos de lenguaje de gran tamaño.

    532+0Variación de estrellas de los últimos 7 días
← Volver a temas