speculative-decoding
Repositorios de código abierto monitorizados etiquetados con speculative-decoding, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a speculative-decoding en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con speculative-decoding.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 962 - #2
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 552
- #1★ 2813+35Variación de estrellas de los últimos 7 días
- #2
Implementación oficial de EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) y EAGLE-3 (NeurIPS'25).
★ 2516+8Variación de estrellas de los últimos 7 días - #3★ 1844+2Variación de estrellas de los últimos 7 días
- #4
Velocidades 3 veces más rápidas en MLX | Qwen 3.8 27B | Decodificación especulativa MTP nativa en Apple Silicon sin necesidad de un borrador externo.
★ 1805+235Variación de estrellas de los últimos 7 días - #5
Kit de herramientas de compresión de modelos diseñado para mejorar la usabilidad, la exhaustividad y la eficiencia.
★ 1579+23Variación de estrellas de los últimos 7 días - #6
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 962+504Variación de estrellas de los últimos 7 días - #7
Una colección curada de artículos, informes técnicos, marcos de trabajo y herramientas para la destilación on-policy (OPD) de modelos de lenguaje de gran tamaño.
★ 761+29Variación de estrellas de los últimos 7 días - #8★ 672+14Variación de estrellas de los últimos 7 días
- #9
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Variación de estrellas de los últimos 7 días - #10
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 552+35Variación de estrellas de los últimos 7 días