Lompat ke konten utama
buildradar
Sign in
Topik · speculative-decoding

speculative-decoding

Repositori open source terpantau bertanda speculative-decoding, diurutkan berdasarkan bintang.

Repositori
10
Total bintang
13.967
Rata-rata bintang
1.397
Porsi
0,00%

Topik yang sering muncul berdampingan dengan speculative-decoding di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda speculative-decoding.

  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    908
  • mlx-dspark@ARahim3

    Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

    624
  • tessera@zengxiao-he

    Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.

    552
  • lucebox@Luce-Org

    Server inferensi spekulatif LLM untuk perangkat konsumen dan heterogen

    2.813+35Perubahan bintang dalam 7 hari terakhir
  • EAGLE@SafeAILab

    Implementasi Resmi dari EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24), dan EAGLE-3 (NeurIPS'25).

    2.516+8Perubahan bintang dalam 7 hari terakhir
  • sonar@dphnAI

    Mesin inferensi LLM berskala besar

    1.844+2Perubahan bintang dalam 7 hari terakhir
  • MTPLX@youssofal

    Kecepatan 3x lebih cepat pada MLX | Qwen 3.8 27B | Native MTP Speculative Decoding pada Apple Silicon tanpa Drafter eksternal.

    1.805+235Perubahan bintang dalam 7 hari terakhir
  • AngelSlim@Tencent

    Toolkit kompresi model yang direkayasa untuk kemudahan penggunaan, kelengkapan, dan efisiensi yang ditingkatkan.

    1.579+23Perubahan bintang dalam 7 hari terakhir
  • Qwen3.8-27B pada satu RTX 3090 dengan vLLM: ~1.000 tok/s pada 64 konkuren (GEMM tensor-core int8, status fp16 DeltaNet), ~114 tok/s pengguna tunggal pada sampling default / ~124 greedy (draft MTP, vocab draft output sendiri, lm_head int4 terkalibrasi, verifikasi attention split-KV), konteks 150k-262k; patch, skrip requant, benchmark

    908+504Perubahan bintang dalam 7 hari terakhir
  • Koleksi makalah, laporan teknis, framework, and alat pilihan untuk on-policy distillation (OPD) pada model bahasa besar

    761+29Perubahan bintang dalam 7 hari terakhir
  • atlas@Avarok-Cybersecurity

    Mesin Inferensi Pure Rust

    672+14Perubahan bintang dalam 7 hari terakhir
  • mlx-dspark@ARahim3

    Dekode LLM hingga 4x lebih cepat di Apple Silicon, tanpa kehilangan data. Port MLX asli dari DSpark DeepSeek & DFlash speculative decoding z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

    624+98Perubahan bintang dalam 7 hari terakhir
  • tessera@zengxiao-he

    Dari guru ke tile — mesin distilasi & penyajian LLM dari awal: kernel Triton/CUDA kustom, distilasi FSDP, batching kontinu paged-KV, dekoding spekulatif, gateway Rust, oracle JAX, dan alat interpretabilitas.

    552+35Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik