databricks-dolly-15k databricks

Summary databricks-dolly-15k is an open source dataset of instruction-following records generated by thousands of Databricks employees in several of the behavioral categories outlined in the InstructGPT paper, including brainstorming, classification, closed QA, generation, information extraction, open QA, and summarization. This dataset can be used for any purpose, whether academic or commercial, under the terms of the Creative Commons Attribution-ShareAlike 3.0 Unported… See the full description on the dataset page: https://huggingface.co/datasets/databricks/databricks-dolly-15k.

Tipo
dataset
Licencia
cc-by-sa-3.0
Lenguaje
en
Descargas
43,318
Me gusta
1,075
Acceso
public
Archivos
0

Etiquetas

  • dataset de instrucciones
  • ajuste fino supervisado
  • LLM
  • instrucciones
  • datos sintéticos
  • NLP
  • texto
  • generación de texto

Resumen

Dolly-15k es un corpus abierto de más de 15,000 registros de instrucciones generados por empleados de Databricks, diseñado para entrenar modelos de lenguaje en el seguimiento de instrucciones interactivo. Cubre ocho categorías del paper InstructGPT (lluvia de ideas, clasificación, QA cerrado/abiert…

README

--- license: cc-by-sa-3.0 task_categories: - question-answering - summarization language: - en size_categories: - 10K<n<100K --- # Resumen `databricks-dolly-15k` es un conjunto de datos de código abierto de registros de seguimiento de instrucciones generados por miles de empleados de Databricks en …

查看完整页面 · 查看原文