Zum Hauptinhalt springen
buildradar
Sign in

IST-DASLab/marlin

@IST-DASLab

FP16xINT4 LLM-Inferenz-Kernel, der bei mittleren Batchgrößen von 16-32 Token nahezu ideale 4-fache Geschwindigkeitssteigerungen erzielen kann.

Sterne
1.138
Forks
92
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 2 Jahren
Pythonllmquantizationkernel4bit

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.