speculative-decoding
Các kho mã nguồn mở đang theo dõi được gắn thẻ speculative-decoding, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng speculative-decoding trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ speculative-decoding.
- #1
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 962 - #2
Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 552
- #1★ 2.813+35Thay đổi số sao trong 7 ngày qua
- #2
Triển khai chính thức của EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) và EAGLE-3 (NeurIPS'25).
★ 2.516+8Thay đổi số sao trong 7 ngày qua - #3★ 1.844+2Thay đổi số sao trong 7 ngày qua
- #4
Tốc độ nhanh hơn 3x trên MLX | Qwen 3.8 27B | Giải mã dự đoán MTP gốc trên Apple Silicon mà không cần trình nháp ngoài.
★ 1.805+235Thay đổi số sao trong 7 ngày qua - #5
Bộ công cụ nén mô hình được thiết kế để nâng cao tính dễ sử dụng, tính toàn diện và hiệu quả.
★ 1.579+23Thay đổi số sao trong 7 ngày qua - #6
Qwen3.8-27B chạy trên một card RTX 3090 duy nhất với vLLM: ~1.000 tok/s ở mức 64 luồng đồng thời (int8 tensor-core GEMMs, trạng thái fp16 DeltaNet), ~114 tok/s cho người dùng đơn lẻ ở chế độ lấy mẫu mặc định / ~124 greedy (MTP drafts, từ vựng dự đoán đầu ra riêng, lm_head int4 đã hiệu chỉnh, split-KV verify attention), ngữ cảnh 150k-262k; bao gồm các bản vá, tập lệnh tái lượng tử hóa và các bài kiểm tra hiệu năng.
★ 962+504Thay đổi số sao trong 7 ngày qua - #7
Bộ sưu tập các bài báo, báo cáo kỹ thuật, khung làm việc và công cụ được tuyển chọn cho việc chưng cất theo chính sách (OPD) của các mô hình ngôn ngữ lớn
★ 761+29Thay đổi số sao trong 7 ngày qua - #8★ 672+14Thay đổi số sao trong 7 ngày qua
- #9
Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Thay đổi số sao trong 7 ngày qua - #10
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 552+35Thay đổi số sao trong 7 ngày qua