Chuyển tới nội dung chính
buildradar
Sign in

esbatmop/MNBVC

@esbatmop

Bộ ngữ liệu tiếng Trung quy mô cực lớn MNBVC (Massive Never-ending BT Vast Chinese corpus). Tương đương với dữ liệu 40T được huấn luyện cho ChatGPT. Tập dữ liệu MNBVC không chỉ bao gồm văn hóa chủ đạo, mà còn bao gồm dữ liệu của các nền văn hóa ngách thậm chí là văn bản sao Hỏa. Tập dữ liệu MNBVC bao gồm tin tức, bài văn, tiểu thuyết, sách, tạp chí, luận văn, lời thoại, bài đăng, wiki, thơ cổ, lời bài hát, giới thiệu sản phẩm, truyện cười, chuyện cười nhảm, lịch sử trò chuyện và tất cả các hình thức dữ liệu văn bản thuần túy bằng tiếng Trung.

Sao
4.272
Fork
297
Ngôn ngữ
Giấy phép
MIT
Push gần nhất
1 tuần trước
chinesechinese-nlpnlpnlp-machine-learningchinese-simplifiedchinese-languagecorpus-data

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.