kv-cache
Repositorios de código abierto monitorizados etiquetados con kv-cache, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a kv-cache en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con kv-cache.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1109
- #1★ 11.622+152Variación de estrellas de los últimos 7 días
- #2★ 3834+1Variación de estrellas de los últimos 7 días
- #3
Métodos unificados de compresión de caché KV para modelos autorregresivos.
★ 1376+1Variación de estrellas de los últimos 7 días - #4★ 1201+7Variación de estrellas de los últimos 7 días
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1109+317Variación de estrellas de los últimos 7 días - #6
Notas sobre LLM, incluyendo inferencia de modelos, estructura de modelos transformer y análisis de código de frameworks de LLM.
★ 889+1Variación de estrellas de los últimos 7 días - #7
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 670+13Variación de estrellas de los últimos 7 días - #8
Realice la inferencia de llama3 paso a paso, comprenda los conceptos básicos, domine la derivación del proceso e implemente el código.
★ 630+0Variación de estrellas de los últimos 7 días - #9
Mixture-of-Recursions: Aprendizaje de profundidades recursivas dinámicas para computación adaptativa a nivel de token (NeurIPS 2025)
★ 583+2Variación de estrellas de los últimos 7 días - #10
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 566+46Variación de estrellas de los últimos 7 días - #11
[NeurIPS'23] H2O: Heavy-Hitter Oracle para la inferencia generativa eficiente de modelos de lenguaje de gran tamaño.
★ 532+0Variación de estrellas de los últimos 7 días