smollm-corpus HuggingFaceTB

SmolLM-Corpus This dataset is a curated collection of high-quality educational and synthetic data designed for training small language models. You can find more details about the models trained on this dataset in our SmolLM blog post. Dataset subsets Cosmopedia v2 Cosmopedia v2 is an enhanced version of Cosmopedia, the largest synthetic dataset for pre-training, consisting of over 39 million textbooks, blog posts, and stories generated by… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceTB/smollm-corpus.

Tipo
dataset
Licencia
odc-by
Lenguaje
en
Descargas
46,086
Me gusta
481
Acceso
public
Archivos
0

Etiquetas

  • preentrenamiento de LLM
  • datos sintéticos
  • corpus de texto
  • datos de código
  • texto web
  • LLM

Resumen

SmolLM-Corpus es un conjunto de datos curado de contenido educativo y sintético de alta calidad diseñado para entrenar modelos de lenguaje pequeños (SmolLM). Incluye tres subconjuntos: Cosmopedia v2 (39M de textos, blogs y libros sintéticos generados por Mixtral), FineWeb-Edu deduplicado (220 mil m…

README

--- license: odc-by dataset_info: - config_name: cosmopedia-v2 features: - name: prompt dtype: string - name: text dtype: string - name: token_length dtype: int64 - name: audience dtype: string - name: format dtype: string - name: seed_data dtype: string splits: - name: train num_bytes: 21250364074…

查看完整页面 · 查看原文