kv-cache
Erfasste Open-Source-Repos mit dem Tag kv-cache, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit kv-cache am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit kv-cache getaggt wurden.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.102
- #1★ 11.622+152Sterne-Änderung der letzten 7 Tage
- #2★ 3.834+1Sterne-Änderung der letzten 7 Tage
- #3
Einheitliche KV-Cache-Kompressionsmethoden für autoregressive Modelle
★ 1.376+1Sterne-Änderung der letzten 7 Tage - #4★ 1.201+7Sterne-Änderung der letzten 7 Tage
- #5
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.102+317Sterne-Änderung der letzten 7 Tage - #6
LLM-Notizen einschließlich Modellinferenz, Transformer-Modellstruktur und Quellcodeanalyse von LLM-Frameworks.
★ 889+1Sterne-Änderung der letzten 7 Tage - #7
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 670+13Sterne-Änderung der letzten 7 Tage - #8
Schritt-für-Schritt-Implementierung der llama3-Inferenz, Verständnis der Kernkonzepte, Beherrschung der Prozessableitung und Implementierung des Codes.
★ 630+0Sterne-Änderung der letzten 7 Tage - #9
Mixture-of-Recursions: Erlernen dynamischer Rekursionstiefen für adaptive Berechnungen auf Token-Ebene (NeurIPS 2025)
★ 583+2Sterne-Änderung der letzten 7 Tage - #10
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 566+46Sterne-Änderung der letzten 7 Tage - #11
[NeurIPS'23] H2O: Heavy-Hitter Oracle für effiziente generative Inferenz großer Sprachmodelle.
★ 532+0Sterne-Änderung der letzten 7 Tage