OpenThoughts-1k-sample ryanmarten

[!NOTE] We have released a paper for OpenThoughts! See our paper here. Open-Thoughts-1k-sample This is a 1k sample of the OpenThoughts-114k dataset. Open synthetic reasoning dataset with high-quality examples covering math, science, code, and puzzles! Inspect the content with rich formatting with Curator Viewer. Available Subsets default subset containing ready-to-train data used to finetune the OpenThinker-7B and OpenThinker-32B models: ds =… See the full description on the dataset page: https://huggingface.co/datasets/ryanmarten/OpenThoughts-1k-sample.

Tipo
dataset
Descargas
1,589,808
Me gusta
49
Acceso
public
Archivos
0

Etiquetas

  • datos sintéticos
  • razonamiento
  • ajuste fino supervisado
  • dataset de código
  • instrucciones
  • LLM
  • programación competitiva
  • preentrenamiento de LLM

Resumen

Este es una muestra de 1.000 ejemplos del dataset OpenThoughts-114k, con datos sintéticos de alta calidad para entrenar modelos de razonamiento. Cubre matemáticas, ciencia, código y puzzles, con trazas de razonamiento generadas por DeepSeek-R1 y soluciones verificadas. Es adecuado para el ajuste fi…

README

--- configs: - config_name: default data_files: - split: train path: data/train-* - config_name: metadata data_files: - split: train path: metadata/train-* dataset_info: - config_name: default features: - name: system dtype: string - name: conversations list: - name: from dtype: string - name: valu…

查看完整页面 · 查看原文