MNBVC liwu
MNBVC: Massive Never-ending BT Vast Chinese corpus
- 类型
- dataset
- 许可
- mit
- 语言
- zh
- 下载量
- 103,490
- 点赞
- 650
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 大语言模型
- 多语言语料
- 代码数据
- 文本生成
- NLP
摘要
MNBVC 是当前规模最大的中文互联网语料集之一,涵盖学术论文、博客、书籍、企业年报、代码、爬虫文本、论坛、游戏平行语料等数十个子集。该数据集主要用于中文大语言模型的预训练与语言建模,覆盖领域广泛、结构化良好,可按标签字典通过 streaming 方式便捷加载,适合自然语言处理研究者和模型训练团队使用。
README
--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…