wikipedia legacy-datasets
Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump (https://dumps.wikimedia.org/) with one split per language. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.).
- 类型
- dataset
- 许可
- cc-by-sa-3.0
- 语言
- aa
- 下载量
- 113,740
- 点赞
- 663
- 访问
- public
- 文件
- 0
标签
- 多语言语料
- 预训练语料
- 文本数据集
- NLP
- 大语言模型
- 预训练
- 语言建模
摘要
这是基于维基百科转储构建的多语言文章数据集,按语言拆分,每条记录包含一篇完整维基百科文章的正文内容,并做了去除标记语言和不必要章节(如参考文献)的清洗处理。该数据集适用于语言建模、掩码语言建模等预训练任务,以及各类NLP下游任务。由于覆盖数百种语言且体积庞大,是训练多语言大语言模型和文本理解模型的重要语料来源。
README
--- annotations_creators: - no-annotation language_creators: - crowdsourced pretty_name: Wikipedia paperswithcode_id: null license: - cc-by-sa-3.0 - gfdl task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling source_datasets: - original multilinguali…