Nemotron-Personas-Korea nvidia
Nemotron-Personas-Korea 우리나라 실제 분포에 기반한 합성 페르소나를 위한 복합 AI 시스템 A compound AI approach to personas grounded in real-world distributions 데이터셋 개요 (Overview) Nemotron-Personas-Korea는 대한민국의 실제 인구통계학적·지리적·성격 특성 분포를 기반으로 합성된 오픈소스 페르소나 데이터셋(CC BY 4.0)으로, 우리나라 인구의 다양성과 특성을 폭넓게 반영하도록 설계되었습니다. 이는 최초의 대규모 우리말 페르소나 데이터셋이며, 이름, 성별, 나이, 혼인 상태, 교육 수준, 직업, 거주 지역 등의 속성을 실제 대한민국 국가데이터처 국가통계포털(KOSIS), 대법원, 국민건강보험공단, 농촌경제연구원, NAVER Cloud 통계 자료를 기반으로 합성하였습니다.… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/Nemotron-Personas-Korea.
- 类型
- dataset
- 许可
- cc-by-4.0
- 语言
- ko
- 下载量
- 8,238
- 点赞
- 541
- 访问
- public
- 文件
- 0
标签
- 多语言语料
- 合成数据
- 文本数据集
- 预训练语料
- 多语言
- 大语言模型
- 数据处理
摘要
Nemotron-Personas-Korea 是英伟达发布的、基于韩国实际人口统计学与地理分布合成的大规模韩语人格数据集(CC BY 4.0),含约100万条样本。数据覆盖姓名、性别、年龄、婚姻、教育、职业、居住区域等属性,旨在扩展合成数据多样性、缓解数据与模型偏见,并支持主权AI(Sovereign AI)的本地化模型开发。适用于训练大语言模型、提升模型回答多样性与防止模型坍塌,由NeMo Data Designer复合AI系统协同Gemma模型生成。
README
--- license: cc-by-4.0 task_categories: - text-generation language: - ko tags: - synthetic - personas - NVIDIA - Korean - datadesigner size_categories: - 1M<n<10M dataset_info: features: - name: uuid dtype: string - name: professional_persona dtype: string - name: sports_persona dtype: string - nam…