跳到主要内容
buildradar
Sign in
主题 · corpus-data

corpus-data

标记 corpus-data 主题、收录中的开源项目,按星标数排序。

项目数
3
总星标数
5,976
平均星标数
1,992
占比
0.00%

常跟 corpus-data 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 corpus-data 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • MNBVC@esbatmop

    MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标 chatGPT 训练的 40T 数据。MNBVC 数据集不仅包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC 数据集包含新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。

    4,272+1近 7 天星标变化
  • ChatGPT 中文语料库 对话语料 小说语料 客服语料 用于训练大模型

    965+1近 7 天星标变化
  • poetry@sheepzh

    地球上最全的华语现代诗歌语料库,3k+ 诗人,80K+ 诗歌,15M+ 字

    740+2近 7 天星标变化
← 返回主题列表