Saltar al contenido principal
buildradar
Sign in
Tema · speculative-decoding

speculative-decoding

Repositorios de código abierto monitorizados etiquetados con speculative-decoding, ordenados por estrellas.

Repositorios
10
Estrellas totales
13.967
Estrellas de media
1397
Proporción
0,00%

Temas que aparecen con frecuencia junto a speculative-decoding en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con speculative-decoding.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    962
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    624
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    552
  • lucebox@Luce-Org

    Servidor de inferencia especulativa de LLM para hardware heterogéneo y de consumo

    2813+35Variación de estrellas de los últimos 7 días
  • EAGLE@SafeAILab

    Implementación oficial de EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) y EAGLE-3 (NeurIPS'25).

    2516+8Variación de estrellas de los últimos 7 días
  • sonar@dphnAI

    Motor de inferencia para LLM a gran escala

    1844+2Variación de estrellas de los últimos 7 días
  • MTPLX@youssofal

    Velocidades 3 veces más rápidas en MLX | Qwen 3.8 27B | Decodificación especulativa MTP nativa en Apple Silicon sin necesidad de un borrador externo.

    1805+235Variación de estrellas de los últimos 7 días
  • AngelSlim@Tencent

    Kit de herramientas de compresión de modelos diseñado para mejorar la usabilidad, la exhaustividad y la eficiencia.

    1579+23Variación de estrellas de los últimos 7 días
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    962+504Variación de estrellas de los últimos 7 días
  • Una colección curada de artículos, informes técnicos, marcos de trabajo y herramientas para la destilación on-policy (OPD) de modelos de lenguaje de gran tamaño.

    761+29Variación de estrellas de los últimos 7 días
  • atlas@Avarok-Cybersecurity

    Motor de inferencia en Rust puro

    672+14Variación de estrellas de los últimos 7 días
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    624+98Variación de estrellas de los últimos 7 días
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    552+35Variación de estrellas de los últimos 7 días
← Volver a temas