Zum Hauptinhalt springen
buildradar
Sign in

patchy631/time-to-first-token

@patchy631

Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.

Sterne
882
Forks
103
Sprache
HTML
Lizenz
Apache-2.0
Letzter Push
vor 4 Wochen
HTMLllmllm-inferencevllmmlopsroadmaplearning-resourcessglang

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.