esbatmop/MNBVC
@esbatmopMNBVC (Massive Never-ending BT Vast Chinese corpus) Korpus bahasa Mandarin berskala sangat besar. Sebanding dengan data 40T untuk pelatihan ChatGPT. Dataset MNBVC tidak hanya mencakup budaya mainstream, tetapi juga berbagai budaya minoritas hingga data alay (Mars). Dataset MNBVC mencakup semua bentuk data teks murni berbahasa Mandarin seperti berita, karangan, novel, buku, majalah, makalah, dialog, postingan, wiki, puisi klasik, lirik lagu, deskripsi produk, lelucon, kisah lucu, dan riwayat obrolan.
Bintang
4.272
Fork
297
Bahasa
—
Lisensi
MIT
Push terakhir
1 minggu yang lalu
Intel terkait (0)
Belum ada intel terkait
Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.