Eigentümer · ztxz16
ztxz16
Erfasste Open-Source-Repos von ztxz16, sortiert nach Sternen.
1 Repo
- #1
fastllm ist eine hochleistungsfähige LLM-Inferenzbibliothek ohne Backend-Abhängigkeiten. Sie unterstützt die Tensor-Parallel-Inferenz für dichte Modelle und den Hybridmodus für MOE-Modelle. Jede Grafikkarte mit 10 GB oder mehr kann DeepSeek in voller Stärke ausführen. Auf einem Dual-9004/9005-Server mit einer einzelnen Grafikkarte erreicht DeepSeek (Originalmodell in voller Präzision) 20 tps bei Einzelkonkurrenz; das INT4-quantisierte Modell erreicht 30 tps bei Einzelkonkurrenz und über 60 tps bei Mehrfachkonkurrenz.
★ 4.954+0Sterne-Änderung der letzten 7 Tage