corpus-data
Dépôts open source suivis étiquetés corpus-data, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de corpus-data sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés corpus-data.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
MNBVC (Massive Never-ending BT Vast Chinese corpus) : un corpus de données chinois à très grande échelle, conçu pour rivaliser avec les 40 To de données d'entraînement de ChatGPT. Le jeu de données MNBVC couvre la culture dominante, les sous-cultures et inclut des textes variés tels que des actualités, romans, articles académiques, scripts, wikis, poésie ancienne, paroles de chansons et journaux de discussion.
★ 4 272+4Évolution des étoiles sur les 7 derniers jours - #2
Corpus de données en chinois pour ChatGPT, incluant des dialogues, des romans et des données de service client pour l'entraînement de grands modèles.
★ 965+1Évolution des étoiles sur les 7 derniers jours - #3
Le corpus de poésie moderne chinoise le plus complet au monde, avec plus de 3 000 poètes, 80 000 poèmes et 15 millions de caractères.
★ 740+1Évolution des étoiles sur les 7 derniers jours