segmentation-3.0 pyannote

类型
model
任务
voice-activity-detection
框架
pyannote-audio
下载量
6,298,482
点赞
1,497
访问
gated
文件
0

标签

  • 语音
  • 音频数据处理
  • 说话人分离
  • 深度学习
  • PyTorch
  • 语音识别

摘要

该模型是 pyannote-audio 框架下的语音活动检测(VAD)模型,用于在音频流中自动识别哪些时间段包含语音、哪些是静音或非语音。它常作为语音识别、说话人分离等下游任务的预处理步骤,适用于电话录音、会议音频、播客等场景。基于深度学习的分割方法,可输出帧级的语音/非语音概率。

查看完整页面 · 查看原文