TinyStories roneneldan
Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in the following paper: https://arxiv.org/abs/2305.07759. The models referred to in the paper were trained on TinyStories-train.txt (the file tinystories-valid.txt can be used for validation loss). These models can be found on Huggingface, at roneneldan/TinyStories-1M/3M/8M/28M/33M/1Layer-21M. Additional resources: tinystories_all_data.tar.gz - contains a superset of… See the full description on the dataset page: https://huggingface.co/datasets/roneneldan/TinyStories.
- Typ
- dataset
- Lizenz
- cdla-sharing-1.0
- Sprache
- en
- Downloads
- 94,684
- Likes
- 1,114
- Zugriff
- public
- Dateien
- 0
Tags
- Synthetische Daten
- Textdatensatz
- Textgenerierung
- Große Sprachmodelle
- Vortrainingskorpus
- Englisch
- Machine Learning
Zusammenfassung
TinyStories ist ein synthetisch erzeugter Datensatz mit kurzen Geschichten, die nur einen kleinen Wortschatz verwenden und von GPT-3.5 und GPT-4 generiert wurden. Er eignet sich zum Training und zur Evaluierung kleiner Sprachmodelle, insbesondere für die Entwicklung von Modellen mit geringer Parame…
README
--- license: cdla-sharing-1.0 task_categories: - text-generation language: - en --- Datensatz mit synthetisch generierten (von GPT-3.5 und GPT-4) Kurzgeschichten, die nur einen kleinen Wortschatz verwenden. Beschrieben in folgendem Paper: https://arxiv.org/abs/2305.07759. Die im Paper referenzierte…