本文目录导读:

BLEU(Bilingual Evaluation Understudy,双语评估替补)是机器翻译领域最经典、最常用的自动评估指标之一,它通过比较机器翻译输出与一个或多个参考翻译之间的n-gram(连续词组)重叠程度,来衡量翻译质量。
核心思想
BLEU认为,好的机器翻译应该与人工参考翻译在词汇选择和语序上尽可能相似,它不直接评估语法或语义,而是基于统计匹配。
计算过程(核心公式)
BLEU的计算包含两大核心部分:n-gram精确率 和 简短惩罚(BP)。
-
计算n-gram精确率(Precision for n-grams)
- 对 n=1, 2, 3, 4 分别计算匹配度(通常使用 4-gram,即 BLEU-4)。
- 公式:( P_n = \frac{\text{候选翻译中与参考翻译匹配的n-gram个数}}{\text{候选翻译中所有n-gram的个数}} )
- 重要限制(改进):为了避免“过度翻译”(如重复出现一个匹配词),采用裁剪计数:每个候选n-gram的匹配次数不超过它在任一参考翻译中出现的最大次数。
-
综合各阶n-gram(几何平均)
- 将不同 n 的精确率取对数并加权平均(通常权重均匀,即 ( wn = 1/4 )): [ \text{BLEU}{\text{score_pre}} = \exp\left( \sum_{n=1}^{N} w_n \log P_n \right) ]
-
简短惩罚(Brevity Penalty, BP)
- 防止模型只输出高精度的短句(例如只输出“是”),对过短的翻译进行惩罚。
- ( BP = \begin{cases} 1 & \text{if } c > r \ e^{(1-r/c)} & \text{if } c \le r \end{cases} )
- ( c ):候选翻译长度
- ( r ):参考翻译有效长度(通常取与候选句长度最接近的参考句长度)
-
最终BLEU分数 [ \text{BLEU} = BP \cdot \exp\left( \sum_{n=1}^{N} w_n \log P_n \right) ]
结果通常乘以100(表示为0-100的分数)。
例子(简化说明)
候选翻译:the cat the cat on the mat
参考翻译:the cat is on the mat
- 1-gram(单词):候选有6个词,匹配词
the (3)、cat (2)、on、mat,但the在参考中只出现2次(裁剪后只算2次),cat只算1次,总匹配次数 = 2+1+1+1 = 5,精确率 P1 = 5/6 ≈ 0.833。 - 2-gram:候选有5个组,匹配组如
the cat、on the、the mat,计算后得到 P2。 - BP:候选长度6 > 参考长度5,BP = 1(无惩罚)。
- 最终BLEU:综合各阶gram后得到一个低于1的数值(例如0.5),再乘以100为50分。
BLEU的优缺点
| 优点 | 缺点 |
|---|---|
| 计算快,成本低,可重复 | 仅依赖词形匹配,不关心语义等价 |
| 与人工评估有一定相关性(尤其在语料级别) | 不惩罚漏译、重复或不当替换 |
| 可跨语言、跨系统比较 | 对创造性翻译或变体翻译非常敏感(如同义词替换) |
| n-gram机制能捕捉局部语序 | 对句子级别的单个分数不可靠(通常用于大规模语料) |
使用场景与注意事项
- 适用:评估主流语言对(如英-中、英-法)的通用机器翻译系统。
- 对比:常与chrF(字符n-gram)、TER(翻译编辑率)、METEOR(引入同义词匹配和语序惩罚)以及语义指标COMET、BLEURT(基于训练模型的评估)搭配使用。
- 底线:BLEU只反映与参考翻译的相似度,并不衡量信息传递是否准确或自然,当参考翻译质量差或风格固定时,BLEU可能产生误导。
BLEU = 简短惩罚 × exp( 1/4 ( log P1 + log P2 + log P3 + log P4 ) )
它对忠实度和流畅度有粗略的捕捉(通过n-gram),但核心是词汇层面的统计匹配,适合作为快速、低成本的基线评估工具,通常需配合其他指标做完整评估。