メインコンテンツへスキップ
buildradar
Sign in
トピック · speculative-decoding

speculative-decoding

speculative-decoding がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
10
総スター数
13,967
平均スター数
1,397
シェア
0.00%

speculative-decoding と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、speculative-decoding がタグ付けされたリポジトリ。

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • mlx-dspark@ARahim3

    Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。

    624
  • tessera@zengxiao-he

    教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。

    552
  • lucebox@Luce-Org

    コンシューマー向けおよび異種混在ハードウェア向けのLLM推測的推論サーバー。

    2,813+35直近 7 日のスター増減
  • EAGLE@SafeAILab

    EAGLE-1 (ICML'24)、EAGLE-2 (EMNLP'24)、EAGLE-3 (NeurIPS'25) の公式実装

    2,516+8直近 7 日のスター増減
  • sonar@dphnAI

    大規模LLM推論エンジン

    1,844+2直近 7 日のスター増減
  • MTPLX@youssofal

    MLX 上で 3 倍高速化 | Qwen 3.8 27B | 外部ドラフターなしで Apple Silicon 上のネイティブ MTP Speculative Decoding に対応

    1,805+235直近 7 日のスター増減
  • AngelSlim@Tencent

    使いやすさ、包括性、効率性を高めるために設計されたモデル圧縮ツールキット

    1,579+23直近 7 日のスター増減
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908+504直近 7 日のスター増減
  • 大規模言語モデルのオンポリシー蒸留(OPD)に関する論文、テクニカルレポート、フレームワーク、ツールの厳選コレクション。

    761+29直近 7 日のスター増減
  • atlas@Avarok-Cybersecurity

    純粋なRust製の推論エンジン

    672+14直近 7 日のスター増減
  • mlx-dspark@ARahim3

    Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。

    624+98直近 7 日のスター増減
  • tessera@zengxiao-he

    教師モデルからタイルまで — フルスクラッチのLLM蒸留・サービングエンジン:カスタムTriton/CUDAカーネル、FSDP蒸留、ページ化KV連続バッチ処理、推測デコーディング、Rustゲートウェイ、JAXオラクル、および解釈可能性ツール。

    552+35直近 7 日のスター増減
← トピック一覧に戻る