Zum Hauptinhalt springen
buildradar
Sign in
Thema · speculative-decoding

speculative-decoding

Erfasste Open-Source-Repos mit dem Tag speculative-decoding, sortiert nach Sternen.

Repos
10
Sterne gesamt
13.967
Sterne im Schnitt
1.397
Anteil
0,00%

Themen, die häufig gemeinsam mit speculative-decoding am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit speculative-decoding getaggt wurden.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    969
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    628
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    559
  • lucebox@Luce-Org

    LLM-Inferenzserver für spekulatives Sampling auf Consumer- und heterogener Hardware

    2.813+35Sterne-Änderung der letzten 7 Tage
  • EAGLE@SafeAILab

    Offizielle Implementierung von EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) und EAGLE-3 (NeurIPS'25).

    2.516+8Sterne-Änderung der letzten 7 Tage
  • sonar@dphnAI

    Skalierbare LLM-Inferenz-Engine

    1.844+2Sterne-Änderung der letzten 7 Tage
  • MTPLX@youssofal

    3x schnellere Geschwindigkeiten auf MLX | Qwen 3.8 27B | Natives MTP Speculative Decoding auf Apple Silicon ohne externen Drafter.

    1.805+235Sterne-Änderung der letzten 7 Tage
  • AngelSlim@Tencent

    Modellkomprimierungs-Toolkit für verbesserte Benutzerfreundlichkeit, Vollständigkeit und Effizienz.

    1.579+23Sterne-Änderung der letzten 7 Tage
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    969+504Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen

    766+29Sterne-Änderung der letzten 7 Tage
  • atlas@Avarok-Cybersecurity

    Reine Rust-Inferenz-Engine

    674+14Sterne-Änderung der letzten 7 Tage
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    628+98Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    559+35Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen