speculative-decoding
Repositórios de código aberto acompanhados marcados com speculative-decoding, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de speculative-decoding no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com speculative-decoding.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.003 - #2
Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.
★ 628 - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 559
- #1★ 2.813+35Variação de estrelas nos últimos 7 dias
- #2
Implementação oficial do EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) e EAGLE-3 (NeurIPS'25).
★ 2.516+8Variação de estrelas nos últimos 7 dias - #3
Velocidades 3x mais rápidas no MLX | Qwen 3.8 27B | Decodificação especulativa MTP nativa em Apple Silicon sem necessidade de rascunhador externo.
★ 1.872+235Variação de estrelas nos últimos 7 dias - #4★ 1.846+2Variação de estrelas nos últimos 7 dias
- #5
Toolkit de compressão de modelos projetado para maior usabilidade, abrangência e eficiência.
★ 1.608+23Variação de estrelas nos últimos 7 dias - #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.003+504Variação de estrelas nos últimos 7 dias - #7
Uma coleção curada de artigos, relatórios técnicos, frameworks e ferramentas para destilação on-policy (OPD) de grandes modelos de linguagem
★ 766+29Variação de estrelas nos últimos 7 dias - #8★ 674+14Variação de estrelas nos últimos 7 dias
- #9
Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.
★ 628+98Variação de estrelas nos últimos 7 dias - #10
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 559+35Variação de estrelas nos últimos 7 dias