dolma allenai

Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

種別
dataset
ライセンス
odc-by
言語
en
ダウンロード
2,870
いいね
1,070
アクセス
public
ファイル
0

タグ

  • 事前学習コーパス
  • 英語コーパス
  • 大規模データセット
  • テキストデータ
  • 言語モデリング
  • コードデータ
  • 大言語モデル

概要

Dolmaは、ウェブコンテンツ・学術論文・コード・書籍・百科事典など多様なソースから構成される3兆トークンの大規模な言語モデル事前学習用コーパスです。OLMoシリーズの学習に利用され、品質フィルタリングや重複除去など厳格なキュレーションが施されており、英語中心のテキスト生成タスク向けに設計されています。ODC-BYライセンスで公開され、LLM事前学習研究に広く利用可能なデータセットです。

README

--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolma's official logo. It's dolma written in yellow, round lowercase letters over a blue background." src=…

查看完整页面 · 查看原文