Lompat ke konten utama
buildradar
Sign in
Topik · corpus-data

corpus-data

Repositori open source terpantau bertanda corpus-data, diurutkan berdasarkan bintang.

Repositori
3
Total bintang
5.973
Rata-rata bintang
1.991
Porsi
0,00%

Topik yang sering muncul berdampingan dengan corpus-data di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda corpus-data.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • MNBVC@esbatmop

    MNBVC (Massive Never-ending BT Vast Chinese corpus) Korpus bahasa Mandarin berskala sangat besar. Sebanding dengan data 40T untuk pelatihan ChatGPT. Dataset MNBVC tidak hanya mencakup budaya mainstream, tetapi juga berbagai budaya minoritas hingga data alay (Mars). Dataset MNBVC mencakup semua bentuk data teks murni berbahasa Mandarin seperti berita, karangan, novel, buku, majalah, makalah, dialog, postingan, wiki, puisi klasik, lirik lagu, deskripsi produk, lelucon, kisah lucu, dan riwayat obrolan.

    4.271+5Perubahan bintang dalam 7 hari terakhir
  • Korpus dialog bahasa Mandarin ChatGPT, korpus novel, korpus layanan pelanggan, digunakan untuk melatih model besar.

    965+1Perubahan bintang dalam 7 hari terakhir
  • poetry@sheepzh

    Korpus puisi modern berbahasa Mandarin terlengkap di bumi, 3k+ penyair, 80K+ puisi, 15M+ kata

    739+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik