मुख्य सामग्री पर जाएँ
buildradar
Sign in

esbatmop/MNBVC

@esbatmop

MNBVC (Massive Never-ending BT Vast Chinese corpus) अति-विशाल चीनी कॉर्पस सेट। ChatGPT प्रशिक्षण के 40T डेटा के समकक्ष। MNBVC डेटासेट में मुख्यधारा की संस्कृति ही नहीं, बल्कि विभिन्न विशिष्ट संस्कृतियों और यहाँ तक कि मार्शियन भाषा का डेटा भी शामिल है। MNBVC डेटासेट में समाचार, निबंध, उपन्यास, किताबें, पत्रिकाएँ,论文, संवाद, पोस्ट, विकी, प्राचीन कविताएँ, गीत, उत्पाद विवरण, चुटकुले, मज़ाक, चैट इतिहास आदि सभी रूपों में शुद्ध पाठ चीनी डेटा शामिल है।

स्टार
4,272
फ़ोर्क
297
भाषा
लाइसेंस
MIT
आख़िरी push
1 सप्ताह पहले
chinesechinese-nlpnlpnlp-machine-learningchinese-simplifiedchinese-languagecorpus-data

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।