fineweb-edu HuggingFaceFW
📚 FineWeb-Edu 1.3 trillion tokens of the finest educational data the 🌐 web has to offer Paper: https://arxiv.org/abs/2406.17557 What is it? 📚 FineWeb-Edu dataset consists of 1.3T tokens and 5.4T tokens (FineWeb-Edu-score-2) of educational web pages filtered from 🍷 FineWeb dataset. This is the 1.3 trillion version. To enhance FineWeb's quality, we developed an educational quality classifier using annotations generated by LLama3-70B-Instruct. We… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu.
- Typ
- dataset
- Lizenz
- odc-by
- Sprache
- en
- Downloads
- 403,783
- Likes
- 1,259
- Zugriff
- public
- Dateien
- 0
Tags
- Vortrainingskorpus
- Textdaten
- Große Sprachmodelle
- Englisch
- Webdaten
- Textgenerierung
- Deduplizierung
- Klassifikation
Zusammenfassung
FineWeb-Edu ist ein großes englisches Webdaten-Korpus mit 1,3 Billionen Token pädagogisch wertvoller Inhalte, das aus dem FineWeb-Datensatz gefiltert wurde. Durch einen eigens entwickelten Bildungsqualitäts-Klassifikator (mithilfe von LLama3-70B-Annotationen) wird die Datenqualität für das Trainier…
README
--- license: odc-by task_categories: - text-generation language: - en pretty_name: FineWeb-Edu size_categories: - n>1T configs: - config_name: default data_files: - split: train path: data/*/* features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype…