wikipedia legacy-datasets
Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump (https://dumps.wikimedia.org/) with one split per language. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.).
- Tipo
- dataset
- Licencia
- cc-by-sa-3.0
- Lenguaje
- aa
- Descargas
- 113,740
- Me gusta
- 663
- Acceso
- public
- Archivos
- 0
Etiquetas
- corpus de texto
- multilingüe
- preentrenamiento de LLM
- texto web
- generación de texto
- NLP
- dataset de texto
Resumen
Conjunto de datos que contiene artículos completos y limpios de Wikipedia en todos los idiomas, construido a partir de los dumps oficiales. Cada ejemplo incluye el contenido íntegro de un artículo con limpieza que elimina markdown y secciones no deseadas como referencias. Es ideal para preentrenami…
README
--- annotations_creators: - no-annotation language_creators: - crowdsourced pretty_name: Wikipedia paperswithcode_id: null license: - cc-by-sa-3.0 - gfdl task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling source_datasets: - original multilinguali…