본문으로 건너뛰기
buildradar
Sign in
토픽 · speculative-decoding

speculative-decoding

speculative-decoding 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
10
총 스타
13,967
평균 스타
1,397
비중
0.00%

같은 리포지토리에 speculative-decoding 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 speculative-decoding 태그가 달린 리포지토리예요.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,035
  • mlx-dspark@ARahim3

    Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.

    628
  • tessera@zengxiao-he

    교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.

    564
  • lucebox@Luce-Org

    소비자용 및 이기종 하드웨어를 위한 LLM 추측적 추론 서버

    2,826+35최근 7일 스타 변화
  • EAGLE@SafeAILab

    EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24), EAGLE-3 (NeurIPS'25) 공식 구현체.

    2,519+8최근 7일 스타 변화
  • MTPLX@youssofal

    MLX에서 3배 더 빠른 속도 | Qwen 3.8 27B | 외부 드래프터 없이 Apple Silicon에서 네이티브 MTP 추측 디코딩.

    1,872+235최근 7일 스타 변화
  • sonar@dphnAI

    대규모 LLM 추론 엔진

    1,846+2최근 7일 스타 변화
  • AngelSlim@Tencent

    향상된 사용성, 포괄성, 효율성을 위해 설계된 모델 압축 툴킷.

    1,608+23최근 7일 스타 변화
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,035+504최근 7일 스타 변화
  • 대형 언어 모델의 온폴리시 증류(OPD)를 위한 논문, 기술 보고서, 프레임워크 및 도구 모음

    766+29최근 7일 스타 변화
  • atlas@Avarok-Cybersecurity

    순수 Rust로 작성된 추론 엔진.

    674+14최근 7일 스타 변화
  • mlx-dspark@ARahim3

    Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.

    628+98최근 7일 스타 변화
  • tessera@zengxiao-he

    교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.

    564+35최근 7일 스타 변화
← 토픽 목록으로