DeepL 团队深度解析:为何翻译质量测试分数已不再可靠?
发布日期:2026 年 8 月 28 日 作者:Morana Peric,DeepL 产品总监(信任与透明度)
引言:分数背后的“数据叙事”
在询问任何 AI 翻译服务的质量时,人们往往会引用一个 0 到 100 的数字。这个分数通常基于某种标准公式计算得出,看似客观、明确,却往往被优化方通过数据解读“量身定制”。
DeepL 对此毫不避讳:我们的质量基准测试显示,在 2026 年 3 月进行的 48,000 次专家盲测中,DeepL 在 16 种语言对和 5 大主要竞争对手(包括所有最强大的 LLM)中,赢得了 94% 的测试组。然而,DeepL 团队承认一个不愿公开的秘密:AI 翻译之间的质量差距正在迅速缩小。
标准化测试的局限性:分数掩盖了真实差距
目前,所有 AI 生成的文本翻译对非专家而言通常都是“良好”的,初看之下错误很少。真正的差异是边缘化、微妙且主观的。这解释了为何市场上存在众多排名,以及为何领先模型总能找到有利于自己的排名。
DeepL 认为,在选择 AI 翻译提供商时,质量确实是一个重要的差异化因素,但不应仅关注测试分数。
测试 vs. 现实:差距的鸿沟
标准化测试中,质量差距看起来微乎其微;但在真实世界中,这些差异巨大且具有实实在在的商业影响。
1. 标准化测试测量的是什么?
当人类语言学家评估翻译时,通常使用 MQM (Multidimensional Quality Metrics) 框架,包含八个质量维度:
- 准确性 (Accuracy):目标语言译文与源语文本内容的精确匹配度。
- 流畅度 (Fluency):译文在目标语言中的自然程度。
- 术语专业性:是否正确处理专业术语。
- 风格反映:是否保留了原文风格。
- 本地惯例:是否符合目标地区的表达习惯。
通过为这些维度分配权重并赋予指标,可以创建一个数学公式,将质量转化为单一分数。
2. 自动化评分系统的演变与缺陷
由于人工评估成本高,许多排名系统转而使用自动化评分:
- BLEU (2001):比较机器译文与人工参考译文的 n-gram 重合度。缺陷在于假设参考译文是完美的,任何偏差都被视为错误。
- TER (2006):计算将机器译文修改为人工译文所需的编辑次数。
- COMET (2020):利用神经网络模型对比机器译文、人工译文和源文本。
- GEMBA (2023):利用 LLM 根据 MQM 维度进行自动评估。
尽管自动化评估不断进步,但仍无法完全匹配人类专家的判断。当 LLM 承担质量评估重任时,会陷入模型偏见:它们倾向于标记自己的译文为最佳,即使缺乏准确性。这就像 AI 在批改自己的作业。
WMT25 会议明确指出:“在自动化指标中领先的系统,在人工评估中并未一致获胜,这表明存在持续的指标偏见,重申人工评估应作为翻译质量的最终裁决者。”
测试缺失的关键要素:语境、确定性与一致性
文章最后指出,传统的翻译质量测试往往忽略了三个在真实业务场景中至关重要的因素:
- 语境 (Context):测试通常基于孤立的句子,缺乏上下文逻辑。
- 确定性 (Determinism):AI 模型在生成时可能存在随机性,而企业应用需要可重复、稳定的输出。
- 一致性 (Consistency):在长文档或多轮对话中,术语和风格的一致性往往被测试忽略。
结语:回归本质
随着 AI 翻译能力的趋同,人类专家在平衡各种质量要素方面的判断变得更为珍贵。DeepL 呼吁开发者与用户:不要只看分数,要看结果。在真实世界中,谁能提供更准确、更流畅、更符合业务场景的翻译,谁才是真正的赢家。
"Quality differences are no longer obvious. At least, not in the standard quality tests." —— Morana Peric, DeepL Product Director