kv-cache
Các kho mã nguồn mở đang theo dõi được gắn thẻ kv-cache, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng kv-cache trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ kv-cache.
- #1
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 1.065 - #2
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 565
- #1★ 11.562+256Thay đổi số sao trong 7 ngày qua
- #2
Một Redis Server và Cluster được triển khai bằng Golang. Máy chủ Redis và cụm phân tán được triển khai bằng ngôn ngữ Go.
★ 3.833-1Thay đổi số sao trong 7 ngày qua - #3
Các phương pháp nén bộ đệm KV thống nhất cho các mô hình tự hồi quy
★ 1.376+1Thay đổi số sao trong 7 ngày qua - #4★ 1.201+16Thay đổi số sao trong 7 ngày qua
- #5
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 1.065+504Thay đổi số sao trong 7 ngày qua - #6
Ghi chú về LLM, bao gồm suy luận mô hình, cấu trúc mô hình transformer và ghi chú phân tích mã nguồn framework LLM.
★ 889+0Thay đổi số sao trong 7 ngày qua - #7
Công cụ suy luận LLM bằng Rust thuần + CUDA — không cần PyTorch, tương thích với OpenAI, hỗ trợ từ Qwen3 đến Kimi-K2.
★ 669+4Thay đổi số sao trong 7 ngày qua - #8
Thực hiện suy luận llama3 từng bước, nắm vững các khái niệm cốt lõi, hiểu rõ quá trình suy luận và triển khai mã nguồn.
★ 630-1Thay đổi số sao trong 7 ngày qua - #9
Mixture-of-Recursions: Học độ sâu đệ quy động cho tính toán cấp token thích ứng (NeurIPS 2025)
★ 581+0Thay đổi số sao trong 7 ngày qua - #10
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 565+35Thay đổi số sao trong 7 ngày qua - #11
[NeurIPS'23] H2O: Heavy-Hitter Oracle cho suy luận tạo sinh hiệu quả của các mô hình ngôn ngữ lớn.
★ 532+3Thay đổi số sao trong 7 ngày qua