pile EleutherAI

The Pile is a 825 GiB diverse, open source language modelling data set that consists of 22 smaller, high-quality datasets combined together.

Typ
dataset
Lizenz
other
Sprache
en
Downloads
2,877
Likes
502
Zugriff
public
Dateien
0

Tags

  • Vortrainingskorpus
  • Textdaten
  • Große Sprachmodelle
  • Englisch
  • Textgenerierung
  • Maskensprachmodellierung
  • NLP
  • Maschinelles Lernen

Zusammenfassung

The Pile ist ein umfangreicher, offener englischer Sprachmodell-Trainingskorpus mit 825 GiB Umfang, der 22 kleinere, hochwertige Datensätze kombiniert. Er unterstützt die Aufgaben Textgenerierung und Maskensprachmodellierung und ist ein zentraler Baustein für das Pretraining großer Sprachmodelle. D…

README

--- annotations_creators: - no-annotation language_creators: - found language: - en license: other multilinguality: - monolingual pretty_name: the Pile size_categories: - 100B<n<1T source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…

查看完整页面 · 查看原文