dolma allenai
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
- Typ
- dataset
- Lizenz
- odc-by
- Sprache
- en
- Downloads
- 2,870
- Likes
- 1,070
- Zugriff
- public
- Dateien
- 0
Tags
- Vortrainingskorpus
- Große Sprachmodelle
- Englisch
- Webdaten
- Code-Daten
- Deduplizierung
- Textgenerierung
- Maschinelles Lernen
Zusammenfassung
Dolma ist ein offener Pretraining-Korpus von AllenAI mit drei Billionen Tokens aus Webinhalten, akademischen Publikationen, Code, Büchern und enzyklopädischen Materialien. Er dient als Trainingsdatenbasis für große Sprachmodelle (u. a. OLMo) und enthält mehrere Versionen mit Qualitätsfilterung und …
README
--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolmas offizielles Logo. Es zeigt „dolma" in gelben, runden Kleinbuchstaben auf blauem Hintergrund." src="…