kv-cache
Dépôts open source suivis étiquetés kv-cache, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de kv-cache sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés kv-cache.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1 109
- #1★ 11 622+152Évolution des étoiles sur les 7 derniers jours
- #2★ 3 834+1Évolution des étoiles sur les 7 derniers jours
- #3
Méthodes unifiées de compression de cache KV pour les modèles auto-régressifs
★ 1 376+1Évolution des étoiles sur les 7 derniers jours - #4★ 1 201+7Évolution des étoiles sur les 7 derniers jours
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1 109+317Évolution des étoiles sur les 7 derniers jours - #6
Notes sur les LLM, incluant l'inférence de modèles, la structure des modèles transformer et l'analyse du code des frameworks LLM.
★ 889+1Évolution des étoiles sur les 7 derniers jours - #7
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 671+13Évolution des étoiles sur les 7 derniers jours - #8
Réalisez l'inférence llama3 étape par étape, saisissez les concepts fondamentaux, maîtrisez la dérivation du processus, implémentez le code.
★ 630+0Évolution des étoiles sur les 7 derniers jours - #9
Mixture-of-Recursions : Apprentissage de profondeurs récursives dynamiques pour le calcul adaptatif au niveau des jetons (NeurIPS 2025)
★ 587+2Évolution des étoiles sur les 7 derniers jours - #10
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+46Évolution des étoiles sur les 7 derniers jours - #11
[NeurIPS'23] H2O : Heavy-Hitter Oracle pour une inférence générative efficace des grands modèles de langage.
★ 532+0Évolution des étoiles sur les 7 derniers jours