wikipedia wikimedia

Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps (https://dumps.wikimedia.org/) with one subset per language, each containing a single train split. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.). All language subsets have already been processed for recent dump… See the full description on the dataset page: https://huggingface.co/datasets/wikimedia/wikipedia.

Tipo
dataset
Licencia
cc-by-sa-3.0
Lenguaje
ab
Descargas
228,662
Me gusta
1,369
Acceso
public
Archivos
0

Etiquetas

  • corpus de texto
  • multilingüe
  • preentrenamiento de LLM
  • texto
  • LLM
  • NLP

Resumen

Dataset de Wikipedia con artículos limpiados de cientos de idiomas, construido a partir de los dumps oficiales. Cada ejemplo contiene el contenido completo de un artículo con limpieza de markdown y secciones no deseadas. Es ideal para pretraining de modelos de lenguaje y modelado de lenguaje enmasc…

README

--- language: - ab - ace - ady - af - alt - am - ami - an - ang - anp - ar - arc - ary - arz - as - ast - atj - av - avk - awa - ay - az - azb - ba - ban - bar - bbc - bcl - be - bg - bh - bi - bjn - blk - bm - bn - bo - bpy - br - bs - bug - bxr - ca - cbk - cdo - ce - ceb - ch - chr - chy - ckb -…

查看完整页面 · 查看原文