OpenR1-Math-220k open-r1

OpenR1-Math-220k Dataset description OpenR1-Math-220k is a large-scale dataset for mathematical reasoning. It consists of 220k math problems with two to four reasoning traces generated by DeepSeek R1 for problems from NuminaMath 1.5. The traces were verified using Math Verify for most samples and Llama-3.3-70B-Instruct as a judge for 12% of the samples, and each problem contains at least one reasoning trace with a correct answer. The dataset consists of two… See the full description on the dataset page: https://huggingface.co/datasets/open-r1/OpenR1-Math-220k.

Typ
dataset
Lizenz
apache-2.0
Sprache
en
Downloads
69,568
Likes
782
Zugriff
public
Dateien
0

Tags

  • Textdaten
  • Textgenerierung
  • Große Sprachmodelle
  • NLP
  • Englisch
  • Synthetische Daten
  • Verfeinerung
  • Transformers

Zusammenfassung

OpenR1-Math-220k ist ein großskaliger englischsprachiger Datensatz für mathematisches Denken mit 220k Problemen aus NuminaMath 1.5 und je zwei bis vier von DeepSeek-R1 generierten Lösungsspuren. Die Spuren wurden mit Math Verify bzw. Llama-3.3-70B als Richter verifiziert, jede Aufgabe enthält minde…

README

--- license: apache-2.0 language: - en configs: - config_name: all data_files: - split: train path: all/train-* - config_name: default data_files: - split: train path: data/train-* - config_name: extended data_files: - split: train path: extended/train-* dataset_info: - config_name: all features: -…

查看完整页面 · 查看原文