speculative-decoding
Erfasste Open-Source-Repos mit dem Tag speculative-decoding, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit speculative-decoding am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit speculative-decoding getaggt wurden.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 969 - #2
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 628 - #3
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 559
- #1
LLM-Inferenzserver für spekulatives Sampling auf Consumer- und heterogener Hardware
★ 2.813+35Sterne-Änderung der letzten 7 Tage - #2
Offizielle Implementierung von EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) und EAGLE-3 (NeurIPS'25).
★ 2.516+8Sterne-Änderung der letzten 7 Tage - #3★ 1.844+2Sterne-Änderung der letzten 7 Tage
- #4
3x schnellere Geschwindigkeiten auf MLX | Qwen 3.8 27B | Natives MTP Speculative Decoding auf Apple Silicon ohne externen Drafter.
★ 1.805+235Sterne-Änderung der letzten 7 Tage - #5
Modellkomprimierungs-Toolkit für verbesserte Benutzerfreundlichkeit, Vollständigkeit und Effizienz.
★ 1.579+23Sterne-Änderung der letzten 7 Tage - #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 969+504Sterne-Änderung der letzten 7 Tage - #7
Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen
★ 766+29Sterne-Änderung der letzten 7 Tage - #8★ 674+14Sterne-Änderung der letzten 7 Tage
- #9
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 628+98Sterne-Änderung der letzten 7 Tage - #10
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 559+35Sterne-Änderung der letzten 7 Tage