MNBVC liwu
MNBVC: Massive Never-ending BT Vast Chinese corpus
- Typ
- dataset
- Lizenz
- mit
- Sprache
- zh
- Downloads
- 103,490
- Likes
- 650
- Zugriff
- public
- Dateien
- 0
Tags
- Vortrainingskorpus
- Textdaten
- Große Sprachmodelle
- Textgenerierung
- Mehrsprachig
- Code-Daten
- Deduplizierung
- NLP
Zusammenfassung
MNBVC ist ein massives, kontinuierlich aktualisiertes chinesisches Internet-Sprachkorpus, das speziell für das Vortraining großer Sprachmodelle entwickelt wurde. Es umfasst zahlreiche Unterkorpora wie akademische Paper, Blogs, Bücher, Code, Foren, Spiele-Texte und gecrawlte Websammlungen. Das Datas…
README
--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…