speculative-decoding
speculative-decoding がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
speculative-decoding と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、speculative-decoding がタグ付けされたリポジトリ。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #2
Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。
★ 624 - #3
教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。
★ 552
- #1★ 2,813+35直近 7 日のスター増減
- #2★ 2,516+8直近 7 日のスター増減
- #3★ 1,844+2直近 7 日のスター増減
- #4
MLX 上で 3 倍高速化 | Qwen 3.8 27B | 外部ドラフターなしで Apple Silicon 上のネイティブ MTP Speculative Decoding に対応
★ 1,805+235直近 7 日のスター増減 - #5★ 1,579+23直近 7 日のスター増減
- #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908+504直近 7 日のスター増減 - #7
大規模言語モデルのオンポリシー蒸留(OPD)に関する論文、テクニカルレポート、フレームワーク、ツールの厳選コレクション。
★ 761+29直近 7 日のスター増減 - #8★ 672+14直近 7 日のスター増減
- #9
Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。
★ 624+98直近 7 日のスター増減 - #10
教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。
★ 552+35直近 7 日のスター増減