pile EleutherAI

The Pile is a 825 GiB diverse, open source language modelling data set that consists of 22 smaller, high-quality datasets combined together.

Tipo
dataset
Licencia
other
Lenguaje
en
Descargas
2,877
Me gusta
502
Acceso
public
Archivos
0

Etiquetas

  • preentrenamiento de LLM
  • corpus de texto
  • NLP
  • texto web
  • dataset de código
  • modelo fundacional

Resumen

The Pile es un extenso dataset de preentrenamiento de modelos de lenguaje de 825 GiB en inglés, compuesto por 22 subconjuntos de alta calidad de fuentes diversas (PubMed, arXiv, código, literatura legal, foros, etc.). Es ampliamente usado por la comunidad para preentrenar LLMs desde cero gracias a …

README

--- annotations_creators: - no-annotation language_creators: - found language: - en license: other multilinguality: - monolingual pretty_name: the Pile size_categories: - 100B<n<1T source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…

查看完整页面 · 查看原文