Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · kv-cache

kv-cache

Các kho mã nguồn mở đang theo dõi được gắn thẻ kv-cache, sắp xếp theo số sao.

Kho mã
11
Tổng số sao
22.673
Số sao trung bình
2.061
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng kv-cache trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ kv-cache.

  • Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.

    1.065
  • tessera@zengxiao-he

    Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.

    565
  • LMCache@LMCache

    LMCache: Tăng tốc LLM của bạn với lớp KV Cache nhanh nhất

    11.562+256Thay đổi số sao trong 7 ngày qua
  • godis@HDT3213

    Một Redis Server và Cluster được triển khai bằng Golang. Máy chủ Redis và cụm phân tán được triển khai bằng ngôn ngữ Go.

    3.833-1Thay đổi số sao trong 7 ngày qua
  • KVCache-Factory@Zefan-Cai

    Các phương pháp nén bộ đệm KV thống nhất cho các mô hình tự hồi quy

    1.376+1Thay đổi số sao trong 7 ngày qua
  • kvpress@NVIDIA

    Làm cho việc nén bộ nhớ đệm KV của LLM trở nên dễ dàng

    1.201+16Thay đổi số sao trong 7 ngày qua
  • Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.

    1.065+504Thay đổi số sao trong 7 ngày qua
  • llm_note@harleyszhang

    Ghi chú về LLM, bao gồm suy luận mô hình, cấu trúc mô hình transformer và ghi chú phân tích mã nguồn framework LLM.

    889+0Thay đổi số sao trong 7 ngày qua
  • pegainfer@pegainfer-project

    Công cụ suy luận LLM bằng Rust thuần + CUDA — không cần PyTorch, tương thích với OpenAI, hỗ trợ từ Qwen3 đến Kimi-K2.

    669+4Thay đổi số sao trong 7 ngày qua
  • Deepdive-llama3-from-scratch@therealoliver

    Thực hiện suy luận llama3 từng bước, nắm vững các khái niệm cốt lõi, hiểu rõ quá trình suy luận và triển khai mã nguồn.

    630-1Thay đổi số sao trong 7 ngày qua
  • mixture_of_recursions@raymin0223

    Mixture-of-Recursions: Học độ sâu đệ quy động cho tính toán cấp token thích ứng (NeurIPS 2025)

    581+0Thay đổi số sao trong 7 ngày qua
  • tessera@zengxiao-he

    Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.

    565+35Thay đổi số sao trong 7 ngày qua
  • H2O@FMInference

    [NeurIPS'23] H2O: Heavy-Hitter Oracle cho suy luận tạo sinh hiệu quả của các mô hình ngôn ngữ lớn.

    532+3Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề