kv-cache
Repositori open source terpantau bertanda kv-cache, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan kv-cache di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda kv-cache.
- #1
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.109
- #1★ 11.622+152Perubahan bintang dalam 7 hari terakhir
- #2★ 3.834+1Perubahan bintang dalam 7 hari terakhir
- #3
Metode Kompresi KV Cache Terpadu untuk Model Auto-Regressive
★ 1.376+1Perubahan bintang dalam 7 hari terakhir - #4★ 1.201+7Perubahan bintang dalam 7 hari terakhir
- #5
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 1.109+317Perubahan bintang dalam 7 hari terakhir - #6
Catatan LLM, termasuk inferensi model, struktur model transformer, dan catatan analisis kode kerangka kerja LLM.
★ 889+1Perubahan bintang dalam 7 hari terakhir - #7
Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2
★ 671+13Perubahan bintang dalam 7 hari terakhir - #8
Pahami inferensi llama3 langkah demi langkah, pahami konsep inti, kuasai penurunan proses, dan implementasikan kodenya.
★ 630+0Perubahan bintang dalam 7 hari terakhir - #9
Mixture-of-Recursions: Mempelajari Kedalaman Rekursif Dinamis untuk Komputasi Tingkat Token Adaptif (NeurIPS 2025)
★ 587+2Perubahan bintang dalam 7 hari terakhir - #10
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 566+46Perubahan bintang dalam 7 hari terakhir - #11
[NeurIPS'23] H2O: Heavy-Hitter Oracle untuk Inferensi Generatif yang Efisien pada Large Language Models.
★ 532+0Perubahan bintang dalam 7 hari terakhir