speculative-decoding
标记 speculative-decoding 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 speculative-decoding 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 speculative-decoding 主题的项目。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,200 - #2
在 Apple Silicon 上实现高达 4 倍更快的 LLM 解码,无损。原生 MLX 移植 DeepSeek 的 DSpark 与 z-lab 的 DFlash 推测解码 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三进制 Bonsai-27B。
★ 640 - #3
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1★ 2,829+16近 7 天星标变化
- #2★ 2,521+7近 7 天星标变化
- #3★ 1,944+173近 7 天星标变化
- #4★ 1,847+3近 7 天星标变化
- #5★ 1,619+58近 7 天星标变化
- #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,200+316近 7 天星标变化 - #7
大语言模型策略内蒸馏(OPD)的精选论文、技术报告、框架与工具集合
★ 791+31近 7 天星标变化 - #8★ 675+3近 7 天星标变化
- #9
在 Apple Silicon 上实现高达 4 倍更快的 LLM 解码,无损。原生 MLX 移植 DeepSeek 的 DSpark 与 z-lab 的 DFlash 推测解码 — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三进制 Bonsai-27B。
★ 640+25近 7 天星标变化 - #10
从教师模型到模型切片——从零开始的 LLM 蒸馏与服务引擎:包含自定义 Triton/CUDA 内核、FSDP 蒸馏、paged-KV 连续批处理、推测解码、Rust 网关、JAX 预测器与可解释性工具。
★ 566+30近 7 天星标变化