oasst1 OpenAssistant

OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.

Tipo
dataset
Licencia
apache-2.0
Lenguaje
en
Descargas
21,688
Me gusta
1,559
Acceso
public
Archivos
0

Etiquetas

  • datos de diálogo
  • multilingüe
  • retroalimentación humana
  • ajuste fino supervisado
  • LLM
  • modelo de lenguaje
  • NLP

Resumen

OASST1 es un corpus de conversaciones estilo asistente generado y anotado por humanos, con 161.443 mensajes en 35 idiomas y más de 10.000 árboles de conversación completos. Incluye 461.292 calificaciones de calidad y etiquetas de feedback humano, por lo que sirve para el ajuste fino supervisado (SF…

README

--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…

查看完整页面 · 查看原文