pile EleutherAI

The Pile is a 825 GiB diverse, open source language modelling data set that consists of 22 smaller, high-quality datasets combined together.

種別
dataset
ライセンス
other
言語
en
ダウンロード
2,877
いいね
502
アクセス
public
ファイル
0

タグ

  • 事前学習コーパス
  • 英語コーパス
  • テキストデータセット
  • 大規模データセット
  • 言語モデリング
  • テキスト生成
  • 深度学习

概要

The Pileは、22個の多様で高品質なデータセットから構成される825GiB規模の大規模英語言語モデリング用コーパスです。PubMed論文や欧州議会議事録、判例、Hacker News、書籍など多岐にわたるジャンルを網羅し、GPT-NeoXなどEleutherAIの大規模言語モデルの事前学習に広く利用されています。言語モデリングの事前学習・評価、マスク言語モデリングなど多様なNLPタスクの基盤データセットとして活用できます。

README

--- annotations_creators: - no-annotation language_creators: - found language: - en license: other multilinguality: - monolingual pretty_name: the Pile size_categories: - 100B<n<1T source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…

查看完整页面 · 查看原文