fineweb-edu HuggingFaceFW
📚 FineWeb-Edu 1.3 trillion tokens of the finest educational data the 🌐 web has to offer Paper: https://arxiv.org/abs/2406.17557 What is it? 📚 FineWeb-Edu dataset consists of 1.3T tokens and 5.4T tokens (FineWeb-Edu-score-2) of educational web pages filtered from 🍷 FineWeb dataset. This is the 1.3 trillion version. To enhance FineWeb's quality, we developed an educational quality classifier using annotations generated by LLama3-70B-Instruct. We… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu.
- Tipo
- dataset
- Licencia
- odc-by
- Lenguaje
- en
- Descargas
- 403,783
- Me gusta
- 1,259
- Acceso
- public
- Archivos
- 0
Etiquetas
- corpus de texto
- preentrenamiento de LLM
- texto web
- generación de texto
- NLP
- dataset de instrucciones
Resumen
FineWeb-Edu es un conjunto de datos de 1,3 billones de tokens extraído de FineWeb que filtra páginas web con alto valor educativo usando un clasificador de calidad educativa desarrollado con anotaciones de Llama3-70B-Instruct. Resuelve el problema de la baja calidad del contenido web para preentren…
README
--- license: odc-by task_categories: - text-generation language: - en pretty_name: FineWeb-Edu size_categories: - n>1T configs: - config_name: default data_files: - split: train path: data/*/* features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype…