corpus-data
Các kho mã nguồn mở đang theo dõi được gắn thẻ corpus-data, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng corpus-data trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ corpus-data.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Bộ ngữ liệu tiếng Trung quy mô cực lớn MNBVC (Massive Never-ending BT Vast Chinese corpus). Tương đương với dữ liệu 40T được huấn luyện cho ChatGPT. Tập dữ liệu MNBVC không chỉ bao gồm văn hóa chủ đạo, mà còn bao gồm dữ liệu của các nền văn hóa ngách thậm chí là văn bản sao Hỏa. Tập dữ liệu MNBVC bao gồm tin tức, bài văn, tiểu thuyết, sách, tạp chí, luận văn, lời thoại, bài đăng, wiki, thơ cổ, lời bài hát, giới thiệu sản phẩm, truyện cười, chuyện cười nhảm, lịch sử trò chuyện và tất cả các hình thức dữ liệu văn bản thuần túy bằng tiếng Trung.
★ 4.272+4Thay đổi số sao trong 7 ngày qua - #2
Bộ dữ liệu tiếng Trung cho ChatGPT, dữ liệu hội thoại, dữ liệu tiểu thuyết, dữ liệu dịch vụ khách hàng dùng để huấn luyện mô hình lớn
★ 965+1Thay đổi số sao trong 7 ngày qua - #3
Kho ngữ liệu thơ hiện đại tiếng Trung đầy đủ nhất trên thế giới, với hơn 3.000 nhà thơ, hơn 80.000 bài thơ và hơn 15 triệu chữ.
★ 740+1Thay đổi số sao trong 7 ngày qua