speculative-decoding
Dépôts open source suivis étiquetés speculative-decoding, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de speculative-decoding sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés speculative-decoding.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1 185 - #2
Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.
★ 640
- #1★ 2 829+16Évolution des étoiles sur les 7 derniers jours
- #2
Implémentation officielle d'EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) et EAGLE-3 (NeurIPS'25).
★ 2 521+7Évolution des étoiles sur les 7 derniers jours - #3
Vitesse 3x plus rapide sur MLX | Qwen 3.8 27B | Décodage spéculatif MTP natif sur Apple Silicon sans drafter externe.
★ 1 944+173Évolution des étoiles sur les 7 derniers jours - #4★ 1 847+3Évolution des étoiles sur les 7 derniers jours
- #5
Boîte à outils de compression de modèles conçue pour une meilleure utilisabilité, exhaustivité et efficacité.
★ 1 619+58Évolution des étoiles sur les 7 derniers jours - #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1 185+285Évolution des étoiles sur les 7 derniers jours - #7
Collection organisée d'articles, de rapports techniques, de frameworks et d'outils pour la distillation on-policy (OPD) des grands modèles de langage
★ 791+26Évolution des étoiles sur les 7 derniers jours - #8★ 675+5Évolution des étoiles sur les 7 derniers jours
- #9
Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.
★ 640+22Évolution des étoiles sur les 7 derniers jours - #10
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 566+30Évolution des étoiles sur les 7 derniers jours