pretraining_v1-omega_books applied-ai-018
- 类型
- dataset
- 下载量
- 708,254
- 点赞
- 24
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 多语言语料
- 大语言模型
- NLP
- 文本生成
摘要
该数据集基于Common Crawl(CC-MAIN-2013-20),包含超过5100万条网络抓取文本样本,数据量约235GB。每条样本包含文本内容、URL来源、语言标识、语言置信度评分及词元数量等丰富元数据,适合用于大语言模型的预训练或继续预训练。该语料规模庞大,覆盖广泛网络内容领域,可满足多语言预训练语料的构建需求。
README
--- dataset_info: config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - n…