MNBVC liwu

MNBVC: Massive Never-ending BT Vast Chinese corpus

Typ
dataset
Lizenz
mit
Sprache
zh
Downloads
103,490
Likes
650
Zugriff
public
Dateien
0

Tags

  • Vortrainingskorpus
  • Textdaten
  • Große Sprachmodelle
  • Textgenerierung
  • Mehrsprachig
  • Code-Daten
  • Deduplizierung
  • NLP

Zusammenfassung

MNBVC ist ein massives, kontinuierlich aktualisiertes chinesisches Internet-Sprachkorpus, das speziell für das Vortraining großer Sprachmodelle entwickelt wurde. Es umfasst zahlreiche Unterkorpora wie akademische Paper, Blogs, Bücher, Code, Foren, Spiele-Texte und gecrawlte Websammlungen. Das Datas…

README

--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…

查看完整页面 · 查看原文