pretraining_v1-omega applied-ai-018
- 类型
- dataset
- 下载量
- 531,436
- 点赞
- 5
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 多语言语料
- 大语言模型
- 预训练
- NLP
摘要
该数据集是 Common Crawl 2013-20 版本的网络爬虫文本数据,包含大规模多语言网页文本,每个样本带有文本、URL、日期、语言及语言置信度、token数等字段。它适用于大语言模型的预训练语料,帮助模型学习广泛的语言知识和世界信息。数据规模庞大(约72亿字节、217万样本),可按 dump 分块加载用于大规模预训练。
README
--- dataset_info: - config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: date dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name:…