Lompat ke konten utama
buildradar
Sign in
Topik · kv-cache

kv-cache

Repositori open source terpantau bertanda kv-cache, diurutkan berdasarkan bintang.

Repositori
11
Total bintang
22.967
Rata-rata bintang
2.088
Porsi
0,00%

Topik yang sering muncul berdampingan dengan kv-cache di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda kv-cache.

  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.109
  • LMCache@LMCache

    LMCache: Tingkatkan LLM Anda dengan lapisan KV Cache tercepat

    11.622+152Perubahan bintang dalam 7 hari terakhir
  • godis@HDT3213

    Server dan Klaster Redis yang diimplementasikan dalam Golang.

    3.834+1Perubahan bintang dalam 7 hari terakhir
  • KVCache-Factory@Zefan-Cai

    Metode Kompresi KV Cache Terpadu untuk Model Auto-Regressive

    1.376+1Perubahan bintang dalam 7 hari terakhir
  • kvpress@NVIDIA

    Kompresi KV cache LLM menjadi lebih mudah

    1.201+7Perubahan bintang dalam 7 hari terakhir
  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    1.109+317Perubahan bintang dalam 7 hari terakhir
  • llm_note@harleyszhang

    Catatan LLM, termasuk inferensi model, struktur model transformer, dan catatan analisis kode kerangka kerja LLM.

    889+1Perubahan bintang dalam 7 hari terakhir
  • pegainfer@pegainfer-project

    Mesin inferensi LLM murni Rust + CUDA — tanpa PyTorch, kompatibel dengan OpenAI, melayani Qwen3 hingga Kimi-K2

    671+13Perubahan bintang dalam 7 hari terakhir
  • Deepdive-llama3-from-scratch@therealoliver

    Pahami inferensi llama3 langkah demi langkah, pahami konsep inti, kuasai penurunan proses, dan implementasikan kodenya.

    630+0Perubahan bintang dalam 7 hari terakhir
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions: Mempelajari Kedalaman Rekursif Dinamis untuk Komputasi Tingkat Token Adaptif (NeurIPS 2025)

    587+2Perubahan bintang dalam 7 hari terakhir
  • tessera@zengxiao-he

    Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.

    566+46Perubahan bintang dalam 7 hari terakhir
  • H2O@FMInference

    [NeurIPS'23] H2O: Heavy-Hitter Oracle untuk Inferensi Generatif yang Efisien pada Large Language Models.

    532+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik