dolma allenai

Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Typ
dataset
Lizenz
odc-by
Sprache
en
Downloads
2,870
Likes
1,070
Zugriff
public
Dateien
0

Tags

  • Vortrainingskorpus
  • Große Sprachmodelle
  • Englisch
  • Webdaten
  • Code-Daten
  • Deduplizierung
  • Textgenerierung
  • Maschinelles Lernen

Zusammenfassung

Dolma ist ein offener Pretraining-Korpus von AllenAI mit drei Billionen Tokens aus Webinhalten, akademischen Publikationen, Code, Büchern und enzyklopädischen Materialien. Er dient als Trainingsdatenbasis für große Sprachmodelle (u. a. OLMo) und enthält mehrere Versionen mit Qualitätsfilterung und …

README

--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolmas offizielles Logo. Es zeigt „dolma" in gelben, runden Kleinbuchstaben auf blauem Hintergrund." src="…

查看完整页面 · 查看原文