cosmopedia HuggingFaceTB

Cosmopedia v0.1 Image generated by DALL-E, the prompt was generated by Mixtral-8x7B-Instruct-v0.1 Note: Cosmopedia v0.2 is available at smollm-corpus User: What do you think "Cosmopedia" could mean? Hint: in our case it's not related to cosmology. Mixtral-8x7B-Instruct-v0.1: A possible meaning for "Cosmopedia" could be an encyclopedia or collection of information about different cultures, societies, and topics from around the world, emphasizing diversity and global… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceTB/cosmopedia.

Tipo
dataset
Licencia
apache-2.0
Lenguaje
en
Descargas
22,274
Me gusta
740
Acceso
public
Archivos
0

Etiquetas

  • datos sintéticos
  • preentrenamiento de LLM
  • generación de texto
  • NLP
  • dataset de instrucciones
  • texto
  • LLM

Resumen

Cosmopedia es el mayor dataset abierto de datos sintéticos, con más de 30 millones de archivos y 25 mil millones de tokens, generado por Mixtral-8x7B-Instruct a partir de muestras semilla de fuentes como web, Stanford y KhanAcademy. Cubre diversas temáticas y estilos (libros de texto, blogs, histor…

README

--- dataset_info: - config_name: auto_math_text features: - name: prompt dtype: string - name: text_token_length dtype: int64 - name: text dtype: string - name: seed_data dtype: string - name: format dtype: string - name: audience dtype: string splits: - name: train num_bytes: 8777587297.907892 num…

查看完整页面 · 查看原文