主题 · corpus-data
corpus-data
标记 corpus-data 主题、收录中的开源项目,按星标数排序。
项目数
3
总星标数
5,976
平均星标数
1,992
占比
0.00%
相关主题
常跟 corpus-data 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 corpus-data 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标 chatGPT 训练的 40T 数据。MNBVC 数据集不仅包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC 数据集包含新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
★ 4,272+1近 7 天星标变化 - #2
ChatGPT 中文语料库 对话语料 小说语料 客服语料 用于训练大模型
★ 965+1近 7 天星标变化 - #3★ 740+2近 7 天星标变化