OpenCodeReasoning nvidia

OpenCodeReasoning: Advancing Data Distillation for Competitive Coding Data Overview OpenCodeReasoning is the largest reasoning-based synthetic dataset to date for coding, comprises 735,255 samples in Python across 28,319 unique competitive programming questions. OpenCodeReasoning is designed for supervised fine-tuning (SFT). Technical Report - Discover the methodology and technical details behind OpenCodeReasoning. Github Repo - Access the complete pipeline used to… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/OpenCodeReasoning.

Tipo
dataset
Licencia
cc-by-4.0
Descargas
14,854
Me gusta
550
Acceso
public
Archivos
0

Etiquetas

  • datos de código
  • datos sintéticos
  • ajuste fino supervisado
  • programación competitiva
  • razonamiento
  • generación de texto
  • distilación de datos

Resumen

OpenCodeReasoning es el mayor conjunto de datos sintéticos basado en razonamiento para programación, con 735.255 ejemplos en Python provenientes de 28.319 problemas únicos de programación competitiva. Diseñado para ajuste fino supervisado (SFT), ofrece respuestas y soluciones de código generadas po…

README

--- license: cc-by-4.0 size_categories: - 100K<n<1M pretty_name: OpenCodeReasoning dataset_info: - config_name: split_0 features: - name: id dtype: string - name: input dtype: string - name: output dtype: string - name: source dtype: string - name: license dtype: string - name: dataset dtype: strin…

查看完整页面 · 查看原文