segmentation-3.0 pyannote
- 类型
- model
- 任务
- voice-activity-detection
- 框架
- pyannote-audio
- 下载量
- 6,298,482
- 点赞
- 1,497
- 访问
- gated
- 文件
- 0
标签
- 语音
- 音频数据处理
- 说话人分离
- 深度学习
- PyTorch
- 语音识别
摘要
该模型是 pyannote-audio 框架下的语音活动检测(VAD)模型,用于在音频流中自动识别哪些时间段包含语音、哪些是静音或非语音。它常作为语音识别、说话人分离等下游任务的预处理步骤,适用于电话录音、会议音频、播客等场景。基于深度学习的分割方法,可输出帧级的语音/非语音概率。