学习专区 | Interprefy

公平的多语言人工智能:欧盟多语言实时翻译基准为何对人工智能实时翻译至关重要

作者: Dayana Abuin Rios | 2026 年 7 月 30 日

目前关于人工智能语言性能的讨论大多仍集中在英语上。一个模型在标准基准测试中表现出色,被誉为最先进的技术,并被推广到全球使用。但越来越多的证据,尤其是 欧盟委员会新推出的欧盟多语言翻译数据集(EU MMLU),表明强大的英语翻译能力并不能说明模型在处理法语、匈牙利语或马耳他语方面的表现。对于任何在国际活动中依赖 人工智能实时翻译的 ,这种差距并非无关紧要。它关系到参会代表能否理解主题演讲,还是完全错过演讲内容。 

这一点至关重要,因为用于评估 大型语言模型 (LLM) 的 决定了哪些系统能够被部署和信任。如果这些基准几乎完全基于英语构建,它们就无法告诉我们模型在其他语言(包括人工智能实时翻译目标受众所使用的语言)中的表现。 

什么是欧盟MMLU基准? 

EU MMLU 是由欧盟委员会翻译总司 (DG Translation) 发布的一项新的多语言基准数据集。它基于 大规模多任务语言理解 (MMLU),MMLU 是评估语言学习模型 (LLM) 最广泛使用的框架之一,它使用涵盖 57 个学科(从科学和法律到伦理和公共事务)的数千道选择题来测试模型。

欧盟多语言能力测试(EU MMLU)针对欧盟环境对该框架进行了专门调整。它聚焦于7个与欧洲机构密切相关的学科领域,目前涵盖16种欧盟官方语言,包括克罗地亚语、捷克语、荷兰语、法语、德语、希腊语、匈牙利语、爱尔兰语、意大利语、立陶宛语、波兰语、葡萄牙语、罗马尼亚语、斯洛伐克语和斯洛文尼亚语,未来还将增加更多语言。该项目并非简单地翻译现有的英文试题,而是力求在所有语言版本中保持相同的含义、难度和测试价值,确保波兰语的分数与法语的分数具有相同的意义。.

为什么有些模特英语很好,其他方面却很吃力 

大多数人工智能评估数据集都是用英语构建的,反映的是英语国家的教育、文化和社会背景。一个主要基于英语数据训练和测试的模型可能看起来非常强大,但它在其他语言上的实际表现却往往被忽略。.

这正是欧盟翻译总司(DG Translation)着手弥合的差距。正如欧盟多语言翻译(MMLU)公告所述,一个模型在英语方面可能表现出色,但在法语、匈牙利语或马耳他语方面却表现显著不佳。根本问题并非模型完全无法处理其他语言,而是标准基准测试很少能对模型进行足够严格的测试,从而揭示其不足之处。因此,语法、细微差别或特定学科术语方面的缺陷往往被忽视,直到真正的受众依赖输出结果时才会显现出来。.

具体到人工智能实时翻译而言,这种性能不均衡会带来直接后果。一个系统或许能够很好地处理简单的英文源材料,但一旦将相同的内容翻译成未经充分测试的目标语言,就会出现错误、措辞生硬或含义丢失等问题,而这恰恰是实时收听者最需要准确性的时刻。.

 

语言和文化偏见如何在实时翻译中体现

语言表现差距只是问题的一部分。欧盟翻译总司还发布了多语言基准测试的质量标准,这些标准不仅关注翻译准确率,还测试人工智能模型在多大程度上体现欧盟价值观,以及处理特定文化内容的能力,包括习语、幽默、典故、日期和数字格式,以及语气或礼貌程度的差异。.

正是这些因素使得实时翻译真正困难。会议发言人如果使用地方习语、文化典故或遵循当地惯例的正式程度,那么翻译就不仅仅是逐字翻译那么简单。如果人工智能系统没有接触过特定语言的这类细微差别,它或许能够正确翻译字面意思,但却完全丢失了原意或语气。在多语种活动中,这种差异会影响部分听众对信息的理解,即使没有人注意到翻译存在任何技术性错误。.

为什么人工审核的多语言数据仍然重要

欧盟多语言能力测试(EU MMLU)最显著的特点之一是其方法论。与大多数主要依赖机器翻译生成非英语测试题的多语言基准测试不同,EU MMLU采用了以人为本的方法。欧盟翻译总司与来自欧洲翻译硕士(EMT)网络的近250名学生译员和项目经理合作,这些译员和项目经理来自欧洲21所大学,共同翻译和修订了1000多道基准测试题。.

这种区别比乍看之下更为重要。通过机器翻译构建的基准测试可能会继承其旨在揭示的自身缺陷,因为它是用模型之间的输出进行对比测试,而不是用真正的人类标准进行对比。人工审核则将评估的重点放在人们实际使用语言的方式上,而这正是真实场合现场翻译最重要的标准——因为在现场,听众是人,对细微翻译错误的容忍度很低。.

更公平的人工智能评估对多语言活动意味着什么  

翻译总司明确阐述了其长期目标:在欧洲建立多语言人工智能评估的新标准,使人工智能系统能够在不同语言和文化背景下保持一致的性能,而不仅仅局限于英语环境。如果这一目标得以实现,其带来的实际益处将远远超出研究实验室的范畴。.

对于举办国际会议、机构会议或全球企业活动的组织而言,更完善的多语言基准测试意味着能够更清晰地了解哪些人工智能系统适用于哪些语言,而无需在活动进行到一半时才发现某个工具在英语以外的语言中表现不佳。这有助​​于更明智地决策,判断哪些情况下纯人工智能实时翻译更可靠,以及哪些情况下采用人工智能与人工翻译相结合的混合方法能更好地保护特定语言或受众的含义和细微差别。.

欧盟多语言实时翻译能力评估(EU MMLU)等基准测试虽然无法在一夜之间解决多语言人工智能的所有难题,但它们代表着性能衡量和沟通方式的重大转变。随着这些评估标准的日趋完善,它们将为活动组织者、机构和传播团队提供更清晰的依据,以便选择真正适合多语言受众的人工智能实时翻译解决方案。如需了解 Interprefy 如何实现跨语言人工智能实时翻译,请探索我们的 人工智能语音翻译平台