Lompat ke konten utama
buildradar
Sign in

esbatmop/MNBVC

@esbatmop

MNBVC (Massive Never-ending BT Vast Chinese corpus) Korpus bahasa Mandarin berskala sangat besar. Sebanding dengan data 40T untuk pelatihan ChatGPT. Dataset MNBVC tidak hanya mencakup budaya mainstream, tetapi juga berbagai budaya minoritas hingga data alay (Mars). Dataset MNBVC mencakup semua bentuk data teks murni berbahasa Mandarin seperti berita, karangan, novel, buku, majalah, makalah, dialog, postingan, wiki, puisi klasik, lirik lagu, deskripsi produk, lelucon, kisah lucu, dan riwayat obrolan.

Bintang
4.272
Fork
297
Bahasa
Lisensi
MIT
Push terakhir
1 minggu yang lalu
chinesechinese-nlpnlpnlp-machine-learningchinese-simplifiedchinese-languagecorpus-data

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.