语音合成MOS分

wen IT资讯 31

本文目录导读:

语音合成MOS分

  1. 评分标准(5分制)
  2. 关键概念澄清
  3. 当前语音合成水平
  4. 应用场景参考

MOS分(Mean Opinion Score,平均意见分) 是评估语音合成(TTS)和语音质量最常用的主观评价指标。

它就是请一批听音人,听完合成语音后,给这段语音的自然度和清晰度打分,然后计算出来的平均分

评分标准(5分制)

MOS 分通常在 1 到 5 之间,对应不同的语音质量感受:

  • 5分 - 优秀:听感与真人说话几乎无差别,非常自然,没有机械感或失真。
  • 4分 - 良好:听感清晰,有轻微的不自然感(如极轻微的电子音或节奏问题),但整体可以接受,不影响理解。
  • 3分 - 一般:能明显听出是机器合成,音质或节奏有缺陷,需要集中注意力才能听清,但内容可懂。
  • 2分 - 较差:有持续性的失真、噪音或音质问题,听感不悦耳,难以听懂。
  • 1分 - 很差:完全无法接受,听不清,噪音极大。

关键概念澄清

  1. 主观 vs. 客观

    • MOS 是主观测试结果(真人听感),不是机器算出来的。
    • 市面上有一些客观指标(如 DNSMOSPESQSTOI)可以预测 MOS 分,但它们只是近似值,不能完全替代真人听音测试。
  2. “高MOS分”不等于“完美”

    • 一个能得 4.5 分的合成系统,意味着它“听起来很清晰,像真人”,但语音的情感、语气、停顿的自然度仍可能与人声有差距。
    • 真人语音的 MOS 分通常在 5 - 4.8 左右,合成语音如果能达到 0 - 4.5,就已经属于非常优秀的水平。
  3. 测试环境要求

    正式 MOS 测试需要在安静的隔音室、用统一的高质量耳机进行,听音人经过筛选(不能有听损),并遵循严格的测试流程(如随机播放、重复试听等)。

当前语音合成水平

  • 传统拼接合成:MOS 约 3.0 - 3.5(机械感较重,不流畅)。
  • 参数合成/早期深度学习:MOS 约 3.5 - 4.0(更流畅,但仍有电子音)。
  • 现代神经网络合成(如 Tacotron 2、WaveNet、FastSpeech + HiFi-GAN)MOS 普遍在 4.0 - 4.5+,在音质和自然度上已经非常接近真人水平(尤其在单一说话人、标准朗读场景下)。

应用场景参考

  • 导航 / 提示音:MOS 3.0 左右就够用。
  • 有声书 / 新闻播报:MOS 4.0 以上才可接受。
  • 虚拟偶像 / 客服对话:需要 MOS 4.5 以上,且兼顾情感表现力(这是当前难点)。
  • MOS分 = 真人听感平均分(1-5分)。
  • 高分好:5分完美,4分良好,3分及格。
  • 当前顶尖合成:可达 4.0 - 4.5 分,已能“以假乱真”到让多数人难以分辨。
  • 局限:在高表现力、多情感、多说话人复杂场景下,MOS 分仍会下降,且无法完全替代真实应用场景测试。

抱歉,评论功能暂时关闭!