Zum Hauptinhalt springen
buildradar
Anmelden

ztxz16/fastllm

@ztxz16

fastllm ist eine hochleistungsfähige LLM-Inferenzbibliothek ohne Backend-Abhängigkeiten. Sie unterstützt die Tensor-Parallel-Inferenz für dichte Modelle und den Hybridmodus für MOE-Modelle. Jede Grafikkarte mit 10 GB oder mehr kann DeepSeek in voller Stärke ausführen. Auf einem Dual-9004/9005-Server mit einer einzelnen Grafikkarte erreicht DeepSeek (Originalmodell in voller Präzision) 20 tps bei Einzelkonkurrenz; das INT4-quantisierte Modell erreicht 30 tps bei Einzelkonkurrenz und über 60 tps bei Mehrfachkonkurrenz.

Sterne
4.954
Forks
485
Sprache
C++
Lizenz
Apache-2.0
Letzter Push
vor 1 Woche
C++

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.