Aller au contenu principal
buildradar
Sign in
Sujet · speculative-decoding

speculative-decoding

Dépôts open source suivis étiquetés speculative-decoding, triés par étoiles.

Dépôts
10
Total d'étoiles
14 467
Étoiles en moyenne
1 447
Part
0,00%

Sujets qui apparaissent souvent aux côtés de speculative-decoding sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés speculative-decoding.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1 185
  • mlx-dspark@ARahim3

    Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.

    640
  • lucebox@Luce-Org

    Serveur d'inférence spéculative LLM pour matériel grand public et hétérogène

    2 829+16Évolution des étoiles sur les 7 derniers jours
  • EAGLE@SafeAILab

    Implémentation officielle d'EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) et EAGLE-3 (NeurIPS'25).

    2 521+7Évolution des étoiles sur les 7 derniers jours
  • MTPLX@youssofal

    Vitesse 3x plus rapide sur MLX | Qwen 3.8 27B | Décodage spéculatif MTP natif sur Apple Silicon sans drafter externe.

    1 944+173Évolution des étoiles sur les 7 derniers jours
  • sonar@dphnAI

    Moteur d'inférence LLM à grande échelle.

    1 847+3Évolution des étoiles sur les 7 derniers jours
  • AngelSlim@Tencent

    Boîte à outils de compression de modèles conçue pour une meilleure utilisabilité, exhaustivité et efficacité.

    1 619+58Évolution des étoiles sur les 7 derniers jours
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1 185+285Évolution des étoiles sur les 7 derniers jours
  • Collection organisée d'articles, de rapports techniques, de frameworks et d'outils pour la distillation on-policy (OPD) des grands modèles de langage

    791+26Évolution des étoiles sur les 7 derniers jours
  • atlas@Avarok-Cybersecurity

    Moteur d'inférence en Rust pur

    675+5Évolution des étoiles sur les 7 derniers jours
  • mlx-dspark@ARahim3

    Décodage LLM jusqu'à 4 fois plus rapide sur Apple Silicon, sans perte. Portage MLX natif du décodage spéculatif DSpark de DeepSeek et DFlash de z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternaire.

    640+22Évolution des étoiles sur les 7 derniers jours
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    566+30Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets