fineweb-2 HuggingFaceFW
🥂 FineWeb2 A sparkling update with 1000s of languages What is it? This is the second iteration of the popular 🍷 FineWeb dataset, bringing high quality pretraining data to over 1000 🗣️ languages. The 🥂 FineWeb2 dataset is fully reproducible, available under the permissive ODC-By 1.0 license and extensively validated through hundreds of ablation experiments. In particular, on the set of 9 diverse languages we used to guide our processing decisions, 🥂… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceFW/fineweb-2.
- Typ
- dataset
- Lizenz
- odc-by
- Sprache
- aai
- Downloads
- 81,095
- Likes
- 858
- Zugriff
- public
- Dateien
- 0
Tags
- Vortrainingskorpus
- Mehrsprachig
- Textdatensatz
- Große Sprachmodelle
- Webdaten
- Deduplizierung
- Textgenerierung
- NLP
Zusammenfassung
FineWeb2 ist die zweite Iteration des beliebten FineWeb-Datensatzes und liefert hochwertige Vortrainingsdaten für über 1000 Sprachen. Der Datensatz ist vollständig reproduzierbar, unter der liberalen ODC-By 1.0-Lizenz verfügbar und wurde durch hunderte Ablationsstudien umfassend validiert. Er eigne…
README
--- license: odc-by task_categories: - text-generation dataset_info: features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: date dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dt…