pretraining_v1-omega_books applied-ai-018

类型
dataset
下载量
708,254
点赞
24
访问
public
文件
0

标签

  • 预训练语料
  • 文本数据集
  • 多语言语料
  • 大语言模型
  • NLP
  • 文本生成

摘要

该数据集基于Common Crawl(CC-MAIN-2013-20),包含超过5100万条网络抓取文本样本,数据量约235GB。每条样本包含文本内容、URL来源、语言标识、语言置信度评分及词元数量等丰富元数据,适合用于大语言模型的预训练或继续预训练。该语料规模庞大,覆盖广泛网络内容领域,可满足多语言预训练语料的构建需求。

README

--- dataset_info: config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - n…

查看完整页面 · 查看原文