medical shibing624

纯文本数据,中文医疗数据集,包含预训练数据的百科数据,指令微调数据和奖励模型数据。

类型
dataset
许可
apache-2.0
语言
zh
下载量
2,536
点赞
440
访问
public
文件
0

标签

  • 预训练语料
  • 指令微调
  • 人类反馈
  • 医学推理
  • 文本数据集
  • 大语言模型
  • 多语言语料

摘要

该数据集面向中文医疗领域大模型训练,整合了预训练(百科与医学教材)、指令微调(中英文医疗问诊对话)以及奖励模型(优质/低质回答对)三部分数据。可用于医疗大模型的全流程训练,包括领域预训练、SFT监督微调与RLHF强化学习,适用于医疗问答与医学知识注入等场景。数据总量约244万条,涵盖中文为主的医疗临床问诊、知识图谱与教材语料。

README

--- license: apache-2.0 language: - zh tags: - text-generation pretty_name: medical task_categories: - text-generation size_categories: - n<1K --- # Dataset Card for medical 中文医疗数据集 - LLM Supervised Finetuning repository: https://github.com/shibing624/textgen - MeidcalGPT repository: https://github…

查看完整页面 · 查看原文