跳到主要內容
buildradar
Sign in
主題 · corpus-data

corpus-data

標記 corpus-data 主題、收錄中的開源專案,依星數排序。

專案數
3
總星數
5,976
平均星數
1,992
佔比
0.00%

常跟 corpus-data 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 corpus-data 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • MNBVC@esbatmop

    MNBVC(Massive Never-ending BT Vast Chinese corpus)超大規模中文語料集。對標 chatGPT 訓練的 40T 數據。MNBVC 數據集不僅包括主流文化,也包括各個小眾文化甚至火星文的數據。MNBVC 數據集包含新聞、作文、小說、書籍、雜誌、論文、台詞、帖子、wiki、古詩、歌詞、商品介紹、笑話、糗事、聊天記錄等一切形式的純文本中文數據。

    4,272+4近 7 天星數變化
  • ChatGPT 中文語料庫 對話語料 小說語料 客服語料 用於訓練大模型

    965+1近 7 天星數變化
  • poetry@sheepzh

    地球上最全的華語現代詩歌語料庫,3k+ 詩人,80K+ 詩歌,15M+ 字

    740+1近 7 天星數變化
← 返回主題列表