corpus-data
Erfasste Open-Source-Repos mit dem Tag corpus-data, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit corpus-data am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit corpus-data getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
MNBVC (Massive Never-ending BT Vast Chinese corpus) – Ein extrem großer chinesischer Korpus als Gegenstück zu den für ChatGPT trainierten 40T-Daten. Das MNBVC-Dataset umfasst Mainstream-Kultur, Nischenkulturen und sogar Websprache in Form von reinen Textdaten wie Nachrichten, Aufsätzen, Romanen, Büchern, Zeitschriften, Arbeiten, Skripten, Posts, Wikis, klassischen Gedichten, Songtexten, Produktbeschreibungen, Witzen und Chatprotokollen.
★ 4.272+4Sterne-Änderung der letzten 7 Tage - #2
Chinesisches ChatGPT-Korpus, Dialogkorpus, Romankorpus, Kundenservice-Korpus zum Trainieren großer Sprachmodelle
★ 965+1Sterne-Änderung der letzten 7 Tage - #3
Das umfassendste Korpus chinesischer moderner Poesie der Erde, über 3.000 Dichter, 80.000+ Gedichte, 15 Mio.+ Wörter
★ 740+1Sterne-Änderung der letzten 7 Tage