fineweb-edu HuggingFaceFW

📚 FineWeb-Edu 1.3 trillion tokens of the finest educational data the 🌐 web has to offer Paper: https://arxiv.org/abs/2406.17557 What is it? 📚 FineWeb-Edu dataset consists of 1.3T tokens and 5.4T tokens (FineWeb-Edu-score-2) of educational web pages filtered from 🍷 FineWeb dataset. This is the 1.3 trillion version. To enhance FineWeb's quality, we developed an educational quality classifier using annotations generated by LLama3-70B-Instruct. We… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu.

Typ
dataset
Lizenz
odc-by
Sprache
en
Downloads
403,783
Likes
1,259
Zugriff
public
Dateien
0

Tags

  • Vortrainingskorpus
  • Textdaten
  • Große Sprachmodelle
  • Englisch
  • Webdaten
  • Textgenerierung
  • Deduplizierung
  • Klassifikation

Zusammenfassung

FineWeb-Edu ist ein großes englisches Webdaten-Korpus mit 1,3 Billionen Token pädagogisch wertvoller Inhalte, das aus dem FineWeb-Datensatz gefiltert wurde. Durch einen eigens entwickelten Bildungsqualitäts-Klassifikator (mithilfe von LLama3-70B-Annotationen) wird die Datenqualität für das Trainier…

README

--- license: odc-by task_categories: - text-generation language: - en pretty_name: FineWeb-Edu size_categories: - n>1T configs: - config_name: default data_files: - split: train path: data/*/* features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype…

查看完整页面 · 查看原文