トピック · corpus-data
corpus-data
corpus-data がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
リポジトリ
3
総スター数
5,976
平均スター数
1,992
シェア
0.00%
関連トピック
corpus-data と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、corpus-data がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大規模中国語コーパス。chatGPTの学習データである40Tに匹敵します。MNBVCデータセットには、主流文化だけでなく、ニッチな文化や火星文のデータも含まれています。MNBVCデータセットには、ニュース、作文、小説、書籍、雑誌、論文、セリフ、投稿、wiki、古典詩、歌詞、商品紹介、ジョーク、失敗談、チャットログなど、あらゆる形式の純粋なテキスト中国語データが含まれています。
★ 4,272+4直近 7 日のスター増減 - #2
大規模言語モデル(LLM)のトレーニングに使用される、ChatGPT中国語コーパス、対話コーパス、小説コーパス、カスタマーサポートコーパス
★ 965+1直近 7 日のスター増減 - #3★ 740+1直近 7 日のスター増減