dolma allenai
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
- 类型
- dataset
- 许可
- odc-by
- 语言
- en
- 下载量
- 2,870
- 点赞
- 1,070
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 大语言模型
- 代码数据
- 多语言语料
- 深度学习
- 预训练
- 数据处理
摘要
Dolma 是由艾伦人工智能研究所(AI2)开发的开源大规模预训练语料库,包含约3万亿 token,来源涵盖网页内容、学术论文、代码、书籍和百科材料等多样化文本。该数据集用于训练 OLMo 系列大语言模型,经过严格的质量过滤和去重处理,并提供多个版本(v1至v1.7)以满足不同训练需求。它面向大语言模型预训练研究,是构建高性能开源中文英文模型的优质数据基础。
README
--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolma官方标志。标志为蓝色背景上用黄色圆体小写字母书写的'dolma'字样。" src="https://raw.githubusercontent.com/allenai/dolma/main/docs/a…