主題 · corpus-data
corpus-data
標記 corpus-data 主題、收錄中的開源專案,依星數排序。
專案數
3
總星數
5,976
平均星數
1,992
佔比
0.00%
相關主題
常跟 corpus-data 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 corpus-data 主題的專案。
近 90 天內還沒有新專案標記這個主題。
- #1
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大規模中文語料集。對標 chatGPT 訓練的 40T 數據。MNBVC 數據集不僅包括主流文化,也包括各個小眾文化甚至火星文的數據。MNBVC 數據集包含新聞、作文、小說、書籍、雜誌、論文、台詞、帖子、wiki、古詩、歌詞、商品介紹、笑話、糗事、聊天記錄等一切形式的純文本中文數據。
★ 4,272+4近 7 天星數變化 - #2
ChatGPT 中文語料庫 對話語料 小說語料 客服語料 用於訓練大模型
★ 965+1近 7 天星數變化 - #3★ 740+1近 7 天星數變化