OpenThoughts-1k-sample ryanmarten
[!NOTE] We have released a paper for OpenThoughts! See our paper here. Open-Thoughts-1k-sample This is a 1k sample of the OpenThoughts-114k dataset. Open synthetic reasoning dataset with high-quality examples covering math, science, code, and puzzles! Inspect the content with rich formatting with Curator Viewer. Available Subsets default subset containing ready-to-train data used to finetune the OpenThinker-7B and OpenThinker-32B models: ds =… See the full description on the dataset page: https://huggingface.co/datasets/ryanmarten/OpenThoughts-1k-sample.
- Tipo
- dataset
- Descargas
- 1,589,808
- Me gusta
- 49
- Acceso
- public
- Archivos
- 0
Etiquetas
- datos sintéticos
- razonamiento
- ajuste fino supervisado
- dataset de código
- instrucciones
- LLM
- programación competitiva
- preentrenamiento de LLM
Resumen
Este es una muestra de 1.000 ejemplos del dataset OpenThoughts-114k, con datos sintéticos de alta calidad para entrenar modelos de razonamiento. Cubre matemáticas, ciencia, código y puzzles, con trazas de razonamiento generadas por DeepSeek-R1 y soluciones verificadas. Es adecuado para el ajuste fi…
README
--- configs: - config_name: default data_files: - split: train path: data/train-* - config_name: metadata data_files: - split: train path: metadata/train-* dataset_info: - config_name: default features: - name: system dtype: string - name: conversations list: - name: from dtype: string - name: valu…