Pular para o conteúdo principal
buildradar
Sign in
Tópico · speculative-decoding

speculative-decoding

Repositórios de código aberto acompanhados marcados com speculative-decoding, ordenados por estrelas.

Repositórios
10
Total de estrelas
13.967
Média de estrelas
1.397
Participação
0,00%

Tópicos que aparecem com frequência ao lado de speculative-decoding no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com speculative-decoding.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.003
  • mlx-dspark@ARahim3

    Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.

    628
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    559
  • lucebox@Luce-Org

    Servidor de inferência especulativa de LLM para hardware de consumo e heterogêneo

    2.813+35Variação de estrelas nos últimos 7 dias
  • EAGLE@SafeAILab

    Implementação oficial do EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) e EAGLE-3 (NeurIPS'25).

    2.516+8Variação de estrelas nos últimos 7 dias
  • MTPLX@youssofal

    Velocidades 3x mais rápidas no MLX | Qwen 3.8 27B | Decodificação especulativa MTP nativa em Apple Silicon sem necessidade de rascunhador externo.

    1.872+235Variação de estrelas nos últimos 7 dias
  • sonar@dphnAI

    Motor de inferência de LLM em larga escala

    1.846+2Variação de estrelas nos últimos 7 dias
  • AngelSlim@Tencent

    Toolkit de compressão de modelos projetado para maior usabilidade, abrangência e eficiência.

    1.608+23Variação de estrelas nos últimos 7 dias
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.003+504Variação de estrelas nos últimos 7 dias
  • Uma coleção curada de artigos, relatórios técnicos, frameworks e ferramentas para destilação on-policy (OPD) de grandes modelos de linguagem

    766+29Variação de estrelas nos últimos 7 dias
  • atlas@Avarok-Cybersecurity

    Motor de inferência puro em Rust

    674+14Variação de estrelas nos últimos 7 dias
  • mlx-dspark@ARahim3

    Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.

    628+98Variação de estrelas nos últimos 7 dias
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    559+35Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos