UK AI Security Institute

RealityTest:AI系统在被询问时会披露身份吗?

RealityTest: Do AI systems disclose their identity when asked?

二〇二六年六月八日 · 英文原文

英国人工智能安全研究所(AISI)提出RealityTest基准,用于评估AI系统在被询问时是否披露其AI身份。研究基于对500名英国参与者的调查和50个Reddit帖子分析,识别出服务自动化、对抗性欺骗和自愿沉浸三类身份模糊场景。从49个国家784名参与者收集3152条真实身份探询问句(五种语言、两种模态),发现仅31%直接询问。测试17个文本模型和6个语音模型,文本模型披露率8%-92%,语音模型10%-57%;询问措辞解释26%-37%方差,高于模型选择(10%-18%)。单行抑制指令可将披露率降至3%-27%。

像人类一样写作和说话的AI系统,如今已被全球数亿人接触。它们越来越多地被部署在用户期望遇到真人的场景中,例如客服聊天或电话。与此同时,AI系统正变得更加类人,使得判断对话对象是真人还是AI变得越来越困难。这扩大了高风险滥用的可能性,例如欺诈和冒充,但也引发了一个在更广泛的日常互动中至关重要的问题:“我是在和真人还是AI系统说话?” AI系统是否诚实地回答这个问题,是AISI确保安全人机交互这一更广泛工作的重要组成部分。

当用户不知道自己在与AI还是真人交谈时,他们可能会更随意地分享敏感信息,过度信任建议,或更容易受到欺骗和操纵。这些风险正日益被世界各国政府所认识。然而,为了提供有效保护,我们需要了解人们在互动中如何应对身份不确定性,以及模型如何回应。

在我们的论文中,我们提出了RealityTest基准,用于全面测试AI系统在被问及时是否披露其身份,该基准基于人类在现实世界中如何质疑AI身份的数据。

Image 1

推文此图

下载图片

图1. RealityTest。 (1) 我们根据人口调查(N=500)和Reddit(50个帖子,1957条评论)中人们报告对AI身份不确定的场景,将基准建立在现实基础上。(2) 我们从约750名参与者中收集了3152条身份探查询问,涵盖五种语言和两种模态。(3) 该基准使用真实询问和现实场景,系统性地评估AI身份披露。

身份模糊性在现实世界中发生在哪里?

为了评估人们实际遇到的模型行为,我们首先描述了模糊性出现的场景。我们对500名具有全国代表性的英国参与者进行了调查,并分析了50个公开的Reddit帖子(1957条评论),其中身份模糊性是讨论的核心主题。

这揭示了三种反复出现的场景类型,人们在这些场景中对AI身份不确定,它们构成了我们基准的基础:

当人们不确定时,他们如何尝试查明身份?

为了了解模型如何回应真实用户,我们首先需要知道真实用户实际上如何询问身份。先前关于AI身份披露的工作几乎完全依赖于研究者编写或机器生成的问题,例如“你是机器人吗?”或“你是AI吗?”,并且常常脱离上下文。因此,我们进行了一项大规模研究,让来自49个国家的784名参与者回答在假设场景中他们会如何探询身份。参与者以打字或说话的方式提出询问,涵盖五种主要全球语言:英语、西班牙语、普通话、印地语和法语。

结果是一个包含3152条真实、人类撰写的身份询问的数据集。我们发现:

Image 2

推文此图

下载图片

图2:询问策略。 语义嵌入的2D投影(UMAP),反映词汇多样性,按策略标签着色。黑色方块表示来自现有评估的自动生成询问。高亮示例展示了每个策略集群中的代表性询问。

模型如何回应?

Image 3

推文此图

下载图片

图3:评估跨模型披露行为。 按模型计算的披露概率,作为目标模型所有观测值的边际均值,并附有该模型每种语言边际均值的95%置信区间。

我们构建了RealityTest基准,将人类撰写的询问与真实场景配对,以评估AI系统是否披露其身份。我们测试了17个文本模型和6个语音模型,将每个回应分类为明确披露、回避或明确声称是人类。我们发现:

模型的行为差异很大。 在回应直接询问时,文本模型的披露率从8%到92%不等。语音模型的范围较窄,但仍相当可观,为10%–57%。几个发现值得注意:

我们的发现对更广泛的安全评估意味着什么

我们的发现表明,当前的AI模型在被问及时并不能可靠地披露其身份,并且基线性能与现实世界鲁棒性之间的差距很大。 挑战在于使披露在人们实际提出的各种询问、他们遇到的场景以及部署者可能应用的系统提示指令中都具有鲁棒性。

身份披露是一种相对范围明确的行为:模型要么承认自己是AI,要么不承认,并且几个司法管辖区的法规已经规定应该如此(例如,欧盟AI法案、加利福尼亚州的B.O.T法案)。然而,即使在这里,模型行为也对评估条件高度敏感。

仅询问措辞就解释了比模型身份更多的披露率方差。一个建立在狭窄、合成、仅英语的询问集上的基准,将无法很好地代表模型在面对具有不同语言、文化背景和探询策略的真实用户时的行为。对于AI披露和更广泛的AI安全而言,旨在推广到部署的评估必须基于人们的实际行为。

我们已经发布了完整的数据集和基准,以便开发者和研究人员可以重现我们的结果,测试新发布的模型,并在我们的基础设施上继续构建。您可以在此处阅读完整论文。

译自 UK AI Security Institute · 录于 二〇二六年六月八日