Saltar al contenido principal
buildradar
Sign in

esbatmop/MNBVC

@esbatmop

MNBVC (Massive Never-ending BT Vast Chinese corpus), un corpus de texto en chino a gran escala. Diseñado para compararse con los 40T de datos de entrenamiento de ChatGPT. El conjunto de datos MNBVC no solo incluye la cultura convencional, sino también culturas minoritarias e incluso texto en 'lenguaje marciano'. El conjunto de datos MNBVC abarca noticias, ensayos, novelas, libros, revistas, tesis, guiones, publicaciones de foros, wikis, poesía clásica, letras de canciones, descripciones de productos, chistes, anécdotas, registros de chat y todo tipo de datos de texto plano en chino.

Estrellas
4272
Bifurcaciones
297
Lenguaje
Licencia
MIT
Último push
hace 1 semana
chinesechinese-nlpnlpnlp-machine-learningchinese-simplifiedchinese-languagecorpus-data

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.