esbatmop 收录中的开源项目,按星标数排序。
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标 chatGPT 训练的 40T 数据。MNBVC 数据集不仅包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC 数据集包含新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。