pile EleutherAI
The Pile is a 825 GiB diverse, open source language modelling data set that consists of 22 smaller, high-quality datasets combined together.
- Tipo
- dataset
- Licencia
- other
- Lenguaje
- en
- Descargas
- 2,877
- Me gusta
- 502
- Acceso
- public
- Archivos
- 0
Etiquetas
- preentrenamiento de LLM
- corpus de texto
- NLP
- texto web
- dataset de código
- modelo fundacional
Resumen
The Pile es un extenso dataset de preentrenamiento de modelos de lenguaje de 825 GiB en inglés, compuesto por 22 subconjuntos de alta calidad de fuentes diversas (PubMed, arXiv, código, literatura legal, foros, etc.). Es ampliamente usado por la comunidad para preentrenar LLMs desde cero gracias a …
README
--- annotations_creators: - no-annotation language_creators: - found language: - en license: other multilinguality: - monolingual pretty_name: the Pile size_categories: - 100B<n<1T source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…