Dia-1.6B nari-labs
- 类型
- model
- 任务
- text-to-speech
- 下载量
- 28,697
- 点赞
- 2,906
- 访问
- public
- 文件
- 0
标签
- 语音合成
- 语音克隆
- 文本生成语音
- 音频生成
- 生成式AI
- 深度学习
- PyTorch
- 多模态
摘要
Dia 是一个 1.6B 参数的文本转语音模型,能够直接从带说话人标签([S1]/[S2])的对话脚本生成高拟真语音,并支持生成笑声、咳嗽等非语言声音。该模型支持音频提示进行音色克隆与控制情绪语调,可保持说话人一致性。适用于对话配音、有声内容制作及语音合成研究等场景,目前仅支持英文,需要约 10GB 显存的 GPU 运行。
README
--- license: apache-2.0 pipeline_tag: text-to-speech language: - en tags: - model_hub_mixin - pytorch_model_hub_mixin widget: - text: "[S1] Dia is an open weights text to dialogue model. [S2] You get full control over scripts and voices. [S1] Wow. Amazing. (laughs) [S2] Try it now on Git hub or Hug…