oasst1 OpenAssistant
OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.
- 種別
- dataset
- ライセンス
- apache-2.0
- 言語
- en
- ダウンロード
- 21,688
- いいね
- 1,559
- アクセス
- public
- ファイル
- 0
タグ
- 对话データ
- 対話データ
- 多言語コーパス
- 指令微调整
- RLHF
- 强化学习
- 人間フィードバック
- 大規模言語モデル
概要
OpenAssistant (OASST1) は、13,500人以上のボランティアがクラウドソーシングで構築した、人間生成・人間注釈付きのアシスタント対話データセットです。35言語で161,443件のメッセージ、461,292件の品質評価、10,000本以上の完全注釈付き会話ツリーを含みます。大規模なアライメント(整列)研究の民主化を目的とし、指示追従型モデルの教師付き微調整(SFT)や報酬モデルの訓練に適しています。
README
--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…