Dia-1.6B nari-labs

类型
model
任务
text-to-speech
下载量
28,697
点赞
2,906
访问
public
文件
0

标签

  • 语音合成
  • 语音克隆
  • 文本生成语音
  • 音频生成
  • 生成式AI
  • 深度学习
  • PyTorch
  • 多模态

摘要

Dia 是一个 1.6B 参数的文本转语音模型,能够直接从带说话人标签([S1]/[S2])的对话脚本生成高拟真语音,并支持生成笑声、咳嗽等非语言声音。该模型支持音频提示进行音色克隆与控制情绪语调,可保持说话人一致性。适用于对话配音、有声内容制作及语音合成研究等场景,目前仅支持英文,需要约 10GB 显存的 GPU 运行。

README

--- license: apache-2.0 pipeline_tag: text-to-speech language: - en tags: - model_hub_mixin - pytorch_model_hub_mixin widget: - text: "[S1] Dia is an open weights text to dialogue model. [S2] You get full control over scripts and voices. [S1] Wow. Amazing. (laughs) [S2] Try it now on Git hub or Hug…

查看完整页面 · 查看原文