Aller au contenu principal
buildradar
Sign in
Sujet · kv-cache

kv-cache

Dépôts open source suivis étiquetés kv-cache, triés par étoiles.

Dépôts
11
Total d'étoiles
22 967
Étoiles en moyenne
2 088
Part
0,00%

Sujets qui apparaissent souvent aux côtés de kv-cache sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés kv-cache.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1 109
  • LMCache@LMCache

    LMCache : Boostez votre LLM avec la couche de cache KV la plus rapide

    11 622+152Évolution des étoiles sur les 7 derniers jours
  • godis@HDT3213

    Serveur et cluster Redis implémentés en Golang

    3 834+1Évolution des étoiles sur les 7 derniers jours
  • KVCache-Factory@Zefan-Cai

    Méthodes unifiées de compression de cache KV pour les modèles auto-régressifs

    1 376+1Évolution des étoiles sur les 7 derniers jours
  • kvpress@NVIDIA

    Compression simplifiée du cache KV pour LLM

    1 201+7Évolution des étoiles sur les 7 derniers jours
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1 109+317Évolution des étoiles sur les 7 derniers jours
  • llm_note@harleyszhang

    Notes sur les LLM, incluant l'inférence de modèles, la structure des modèles transformer et l'analyse du code des frameworks LLM.

    889+1Évolution des étoiles sur les 7 derniers jours
  • pegainfer@pegainfer-project

    Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.

    671+13Évolution des étoiles sur les 7 derniers jours
  • Deepdive-llama3-from-scratch@therealoliver

    Réalisez l'inférence llama3 étape par étape, saisissez les concepts fondamentaux, maîtrisez la dérivation du processus, implémentez le code.

    630+0Évolution des étoiles sur les 7 derniers jours
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions : Apprentissage de profondeurs récursives dynamiques pour le calcul adaptatif au niveau des jetons (NeurIPS 2025)

    587+2Évolution des étoiles sur les 7 derniers jours
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+46Évolution des étoiles sur les 7 derniers jours
  • H2O@FMInference

    [NeurIPS'23] H2O : Heavy-Hitter Oracle pour une inférence générative efficace des grands modèles de langage.

    532+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets