跳到主要內容
buildradar
Sign in

esbatmop/MNBVC

@esbatmop

MNBVC(Massive Never-ending BT Vast Chinese corpus)超大規模中文語料集。對標 chatGPT 訓練的 40T 數據。MNBVC 數據集不僅包括主流文化,也包括各個小眾文化甚至火星文的數據。MNBVC 數據集包含新聞、作文、小說、書籍、雜誌、論文、台詞、帖子、wiki、古詩、歌詞、商品介紹、笑話、糗事、聊天記錄等一切形式的純文本中文數據。

星數
4,272
Fork 數
297
語言
授權
MIT
最後推送
1 週前
chinesechinese-nlpnlpnlp-machine-learningchinese-simplifiedchinese-languagecorpus-data

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。