ztxz16/fastllm
@ztxz16fastllm ist eine hochleistungsfähige LLM-Inferenzbibliothek ohne Backend-Abhängigkeiten. Sie unterstützt die Tensor-Parallel-Inferenz für dichte Modelle und den Hybridmodus für MOE-Modelle. Jede Grafikkarte mit 10 GB oder mehr kann DeepSeek in voller Stärke ausführen. Auf einem Dual-9004/9005-Server mit einer einzelnen Grafikkarte erreicht DeepSeek (Originalmodell in voller Präzision) 20 tps bei Einzelkonkurrenz; das INT4-quantisierte Modell erreicht 30 tps bei Einzelkonkurrenz und über 60 tps bei Mehrfachkonkurrenz.
Sterne
4.954
Forks
485
Sprache
C++
Lizenz
Apache-2.0
Letzter Push
vor 1 Woche
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.