Zum Hauptinhalt springen
buildradar
Sign in
Thema · kv-cache

kv-cache

Erfasste Open-Source-Repos mit dem Tag kv-cache, sortiert nach Sternen.

Repos
11
Sterne gesamt
22.967
Sterne im Schnitt
2.088
Anteil
0,00%

Themen, die häufig gemeinsam mit kv-cache am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit kv-cache getaggt wurden.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.102
  • LMCache@LMCache

    LMCache: Beschleunigen Sie Ihr LLM mit der schnellsten KV-Cache-Schicht

    11.622+152Sterne-Änderung der letzten 7 Tage
  • godis@HDT3213

    Ein in Golang implementierter Redis-Server und -Cluster.

    3.834+1Sterne-Änderung der letzten 7 Tage
  • KVCache-Factory@Zefan-Cai

    Einheitliche KV-Cache-Kompressionsmethoden für autoregressive Modelle

    1.376+1Sterne-Änderung der letzten 7 Tage
  • kvpress@NVIDIA

    LLM-KV-Cache-Kompprimierung leicht gemacht

    1.201+7Sterne-Änderung der letzten 7 Tage
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.102+317Sterne-Änderung der letzten 7 Tage
  • llm_note@harleyszhang

    LLM-Notizen einschließlich Modellinferenz, Transformer-Modellstruktur und Quellcodeanalyse von LLM-Frameworks.

    889+1Sterne-Änderung der letzten 7 Tage
  • pegainfer@pegainfer-project

    Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2

    670+13Sterne-Änderung der letzten 7 Tage
  • Deepdive-llama3-from-scratch@therealoliver

    Schritt-für-Schritt-Implementierung der llama3-Inferenz, Verständnis der Kernkonzepte, Beherrschung der Prozessableitung und Implementierung des Codes.

    630+0Sterne-Änderung der letzten 7 Tage
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions: Erlernen dynamischer Rekursionstiefen für adaptive Berechnungen auf Token-Ebene (NeurIPS 2025)

    583+2Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    566+46Sterne-Änderung der letzten 7 Tage
  • H2O@FMInference

    [NeurIPS'23] H2O: Heavy-Hitter Oracle für effiziente generative Inferenz großer Sprachmodelle.

    532+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen