मुख्य सामग्री पर जाएँ
buildradar
साइन इन करें

ztxz16/fastllm

@ztxz16

fastllm बैकएंड-मुक्त, उच्च-प्रदर्शन वाला लार्ज लैंग्वेज मॉडल (LLM) इन्फरेंस लाइब्रेरी है। यह डेंस मॉडल के टेंसर पैरेलल इन्फरेंस और MOE मॉडल के हाइब्रिड मोड इन्फरेंस दोनों का समर्थन करता है। 10G से अधिक मेमोरी वाला कोई भी ग्राफिक्स कार्ड पूर्ण-क्षमता वाले DeepSeek का इन्फरेंस कर सकता है। डुअल-वे 9004/9005 सर्वर + सिंगल ग्राफिक्स कार्ड पर पूर्ण-क्षमता और पूर्ण-परिशुद्धता वाले मूल DeepSeek मॉडल को डिप्लॉय करने पर, सिंगल-कन्करेंसी 20tps; INT4 क्वांटाइज्ड मॉडल सिंगल-कन्करेंसी 30tps और मल्टी-कन्करेंसी 60+ tps तक पहुंच सकती है।

स्टार
5,015
फ़ोर्क
488
भाषा
C++
लाइसेंस
Apache-2.0
आख़िरी push
18 घंटे पहले
C++

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।