UltraFeedback openbmb

Introduction GitHub Repo UltraRM-13b UltraCM-13b UltraFeedback is a large-scale, fine-grained, diverse preference dataset, used for training powerful reward models and critic models. We collect about 64k prompts from diverse resources (including UltraChat, ShareGPT, Evol-Instruct, TruthfulQA, FalseQA, and FLAN). We then use these prompts to query multiple LLMs (see Table for model lists) and generate 4 different responses for each prompt, resulting in a total of 256k samples. To… See the full description on the dataset page: https://huggingface.co/datasets/openbmb/UltraFeedback.

Typ
dataset
Lizenz
mit
Sprache
en
Downloads
5,838
Likes
432
Zugriff
public
Dateien
0

Tags

  • Synthetische Daten
  • Präferenzdaten
  • Große Sprachmodelle
  • Textgenerierung
  • Bewertungsdaten
  • NLP
  • Verfeinerung
  • Englisch

Zusammenfassung

UltraFeedback ist ein umfangreiches, feinkörniges Präferenz-Dataset mit rund 64k Prompts und 256k Antworten von 17 verschiedenen LLMs, annotiert durch GPT-4 in vier Dimensionen (Instruction-Following, Wahrhaftigkeit, Ehrlichkeit und Hilfsbereitschaft). Es dient dem Training leistungsfähiger Reward-…

README

--- license: mit task_categories: - text-generation language: - en size_categories: - 100K<n<1M --- ## Einführung - [GitHub Repo](https://github.com/thunlp/UltraFeedback) - [UltraRM-13b](https://huggingface.co/openbmb/UltraRM-13b) - [UltraCM-13b](https://huggingface.co/openbmb/UltraCM-13b) UltraFee…

查看完整页面 · 查看原文