wikipedia legacy-datasets
Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump (https://dumps.wikimedia.org/) with one split per language. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.).
- Typ
- dataset
- Lizenz
- cc-by-sa-3.0
- Sprache
- aa
- Downloads
- 113,740
- Likes
- 663
- Zugriff
- public
- Dateien
- 0
Tags
- Vortrainingskorpus
- Mehrsprachig
- Textdatensatz
- NLP
- Große Sprachmodelle
- Maskensprachmodellierung
- Textgenerierung
- Maschinelles Lernen
Zusammenfassung
Dieses Dataset enthält bereinigte Wikipedia-Artikel in über 300 Sprachen, aufbereitet aus offiziellen Dumps von dumps.wikimedia.org. Es löst das Problem der Bereitstellung eines großen, mehrsprachigen Pre-Training-Korpus für Sprachmodelle, indem Markdown und unerwünschte Abschnitte (Referenzen etc.…
README
--- annotations_creators: - no-annotation language_creators: - crowdsourced pretty_name: Wikipedia paperswithcode_id: null license: - cc-by-sa-3.0 - gfdl task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling source_datasets: - original multilinguali…