speculative-decoding
Repositori open source terpantau bertanda speculative-decoding, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan speculative-decoding di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda speculative-decoding.
- #1
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 908 - #2
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 552
- #1★ 2.813+35Perubahan bintang dalam 7 hari terakhir
- #2
Implementasi Resmi dari EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24), dan EAGLE-3 (NeurIPS'25).
★ 2.516+8Perubahan bintang dalam 7 hari terakhir - #3★ 1.844+2Perubahan bintang dalam 7 hari terakhir
- #4
Kecepatan 3x lebih cepat pada MLX | Qwen 3.8 27B | Native MTP Speculative Decoding pada Apple Silicon tanpa Drafter eksternal.
★ 1.805+235Perubahan bintang dalam 7 hari terakhir - #5
Toolkit kompresi model yang direkayasa untuk kemudahan penggunaan, kelengkapan, dan efisiensi yang ditingkatkan.
★ 1.579+23Perubahan bintang dalam 7 hari terakhir - #6
Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark
★ 908+504Perubahan bintang dalam 7 hari terakhir - #7
Koleksi makalah, laporan teknis, framework, and alat pilihan untuk on-policy distillation (OPD) pada model bahasa besar
★ 761+29Perubahan bintang dalam 7 hari terakhir - #8★ 672+14Perubahan bintang dalam 7 hari terakhir
- #9
Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Perubahan bintang dalam 7 hari terakhir - #10
Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.
★ 552+35Perubahan bintang dalam 7 hari terakhir