c4 allenai

C4 Dataset Summary A colossal, cleaned version of Common Crawl's web crawl corpus. Based on Common Crawl dataset: "https://commoncrawl.org". This is the processed version of Google's C4 dataset We prepared five variants of the data: en, en.noclean, en.noblocklist, realnewslike, and multilingual (mC4). For reference, these are the sizes of the variants: en: 305GB en.noclean: 2.3TB en.noblocklist: 380GB realnewslike: 15GB multilingual (mC4): 9.7TB (108 subsets, one… See the full description on the dataset page: https://huggingface.co/datasets/allenai/c4.

Tipo
dataset
Licencia
odc-by
Lenguaje
af
Descargas
1,430,934
Me gusta
630
Acceso
public
Archivos
0

Etiquetas

  • preentrenamiento
  • corpus de texto
  • multilingüe
  • texto web
  • generación de texto
  • modelo de lenguaje
  • relleno de máscara
  • NLP

Resumen

C4 es un corpus web colosal y depurado derivado de Common Crawl, diseñado para el preentrenamiento de modelos de lenguaje. Ofrece variantes en inglés, multilingüe (mC4, 107 idiomas), y versiones sin filtrar o sin listas de bloqueo, adaptadas a distintos casos de uso. Es el estándar de facto para en…

README

--- pretty_name: C4 annotations_creators: - no-annotation language_creators: - found language: - af - am - ar - az - be - bg - bn - ca - ceb - co - cs - cy - da - de - el - en - eo - es - et - eu - fa - fi - fil - fr - fy - ga - gd - gl - gu - ha - haw - he - hi - hmn - ht - hu - hy - id - ig - is …

查看完整页面 · 查看原文