TinyStories roneneldan
Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in the following paper: https://arxiv.org/abs/2305.07759. The models referred to in the paper were trained on TinyStories-train.txt (the file tinystories-valid.txt can be used for validation loss). These models can be found on Huggingface, at roneneldan/TinyStories-1M/3M/8M/28M/33M/1Layer-21M. Additional resources: tinystories_all_data.tar.gz - contains a superset of… See the full description on the dataset page: https://huggingface.co/datasets/roneneldan/TinyStories.
- 类型
- dataset
- 许可
- cdla-sharing-1.0
- 语言
- en
- 下载量
- 94,684
- 点赞
- 1,114
- 访问
- public
- 文件
- 0
标签
- 合成数据
- 文本数据集
- 文本生成
- 预训练语料
- 大语言模型
摘要
TinyStories 是由 GPT-3.5 和 GPT-4 合成生成的英文短篇故事数据集,仅使用较小词汇量,专为训练和评测小型语言模型而设计。该数据集解决了小模型在受限数据集上训练的问题,可评估小模型的生成与推理能力,适合用于语言模型研究、教学和小型模型训练场景。
README
--- license: cdla-sharing-1.0 task_categories: - text-generation language: - en --- 包含由 GPT-3.5 和 GPT-4 合成生成的短篇故事的数据集,仅使用少量词汇。 在以下论文中描述:https://arxiv.org/abs/2305.07759。 论文中提到的模型是在 TinyStories-train.txt 上训练的(文件 tinystories-valid.txt 可用于验证损失)。这些模型可以在 Huggingface 上找到,位于 roneneldan/TinyStories-1M/3M/8…