patchy631/time-to-first-token
@patchy631Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.
Sterne
882
Forks
103
Sprache
HTML
Lizenz
Apache-2.0
Letzter Push
vor 4 Wochen
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.