oasst1 OpenAssistant
OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.
- Tipo
- dataset
- Licencia
- apache-2.0
- Lenguaje
- en
- Descargas
- 21,688
- Me gusta
- 1,559
- Acceso
- public
- Archivos
- 0
Etiquetas
- datos de diálogo
- multilingüe
- retroalimentación humana
- ajuste fino supervisado
- LLM
- modelo de lenguaje
- NLP
Resumen
OASST1 es un corpus de conversaciones estilo asistente generado y anotado por humanos, con 161.443 mensajes en 35 idiomas y más de 10.000 árboles de conversación completos. Incluye 461.292 calificaciones de calidad y etiquetas de feedback humano, por lo que sirve para el ajuste fino supervisado (SF…
README
--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…