本文目录导读:

MOS分(Mean Opinion Score,平均意见分) 是评估语音合成(TTS)和语音质量最常用的主观评价指标。
它就是请一批听音人,听完合成语音后,给这段语音的自然度和清晰度打分,然后计算出来的平均分。
评分标准(5分制)
MOS 分通常在 1 到 5 之间,对应不同的语音质量感受:
- 5分 - 优秀:听感与真人说话几乎无差别,非常自然,没有机械感或失真。
- 4分 - 良好:听感清晰,有轻微的不自然感(如极轻微的电子音或节奏问题),但整体可以接受,不影响理解。
- 3分 - 一般:能明显听出是机器合成,音质或节奏有缺陷,需要集中注意力才能听清,但内容可懂。
- 2分 - 较差:有持续性的失真、噪音或音质问题,听感不悦耳,难以听懂。
- 1分 - 很差:完全无法接受,听不清,噪音极大。
关键概念澄清
-
主观 vs. 客观:
- MOS 是主观测试结果(真人听感),不是机器算出来的。
- 市面上有一些客观指标(如 DNSMOS、PESQ、STOI)可以预测 MOS 分,但它们只是近似值,不能完全替代真人听音测试。
-
“高MOS分”不等于“完美”:
- 一个能得 4.5 分的合成系统,意味着它“听起来很清晰,像真人”,但语音的情感、语气、停顿的自然度仍可能与人声有差距。
- 真人语音的 MOS 分通常在 5 - 4.8 左右,合成语音如果能达到 0 - 4.5,就已经属于非常优秀的水平。
-
测试环境要求:
正式 MOS 测试需要在安静的隔音室、用统一的高质量耳机进行,听音人经过筛选(不能有听损),并遵循严格的测试流程(如随机播放、重复试听等)。
当前语音合成水平
- 传统拼接合成:MOS 约 3.0 - 3.5(机械感较重,不流畅)。
- 参数合成/早期深度学习:MOS 约 3.5 - 4.0(更流畅,但仍有电子音)。
- 现代神经网络合成(如 Tacotron 2、WaveNet、FastSpeech + HiFi-GAN):MOS 普遍在 4.0 - 4.5+,在音质和自然度上已经非常接近真人水平(尤其在单一说话人、标准朗读场景下)。
应用场景参考
- 导航 / 提示音:MOS 3.0 左右就够用。
- 有声书 / 新闻播报:MOS 4.0 以上才可接受。
- 虚拟偶像 / 客服对话:需要 MOS 4.5 以上,且兼顾情感表现力(这是当前难点)。
- MOS分 = 真人听感平均分(1-5分)。
- 高分好:5分完美,4分良好,3分及格。
- 当前顶尖合成:可达 4.0 - 4.5 分,已能“以假乱真”到让多数人难以分辨。
- 局限:在高表现力、多情感、多说话人复杂场景下,MOS 分仍会下降,且无法完全替代真实应用场景测试。