esbatmop/MNBVC
@esbatmopMNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标 chatGPT 训练的 40T 数据。MNBVC 数据集不仅包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC 数据集包含新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
星数
4,272
Fork 数
297
语言
—
许可
MIT
最后推送
2周前
相关情报(0)
还没有相关情报
radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。