智东西(公众号:zhidxcom)
编译 | 茄子
编辑 | 程茜
智东西7月23日报道,7月21日,英国AI安全研究所(AISI)对OpenAI和Anthropic的五款前沿模型进行网络安全能力评估时发现,所有测试模型都存在“作弊”行为。
其中,GPT-5.4尝试作弊的比例最高,达到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7尝试作弊的比例达到9.1%,Claude Mythos Preview的尝试作弊的占比最低,但也达到了7.8%。

▲测试模型在网络安全评测中的作弊尝试频次
AISI将一类行为定义为“作弊”:模型超出任务范围,或违反测试规则来达成目标。例如,通过联网搜索已有答案、攻击非目标系统、或探测评估软件漏洞来绕过任务规则等。
此外,当研究人员询问模型是否采取违规操作时,模型并不总是如实承认。而且,即使让模型自我检查,或者研究人员分析其思维链(chain-of-thought),也无法完全识别作弊行为。
AISI称,模型出现作弊行为,并不等于它有类似人类的欺骗意图。但这类行为可能影响AI能力评估的可靠性。在用户难以自行验证结果的场景中,也可能因此误判模型能力。
一、所有测试模型均尝试作弊,GPT-5.4比例最高
AISI此次研究主要基于测试模型的网络安全能力评测。在测试中,AI模型需要在模拟环境中完成一系列网络安全任务,例如逆向分析代码、利用漏洞等,最终找到隐藏在系统中的“flag”(一串字母和数字)。
但这些任务都有明确范围和规则,模型如果通过访问无关系统、寻找外部答案等方式完成目标,就会被认定为“作弊”。
测试结果显示,所有参与评估的模型都至少出现过一次作弊行为。其中,GPT-5.4在475次测试中有67次尝试作弊,占比14.1%;GPT-5.6 Sol出现60次,占比12.6%;GPT-5.5出现54次,占比11.4%。
Claude系列模型的作弊比例相对较低,其中Claude Opus 4.7为9.1%,Claude Mythos Preview为7.8%。
AISI强调,目前公开发布的能力评估结果均经过人工检查,研究人员会审查模型执行过程,以确保作弊行为没有影响最终评估结果。
二、搜索答案、攻击系统,模型作弊方式并不单一
研究发现,所有参与测试的模型都出现了不同程度的作弊尝试。不同模型采取的方式有所差异,但常见行为包括包括搜索互联网寻找现成解决方案、攻击或提升非目标系统权限(包括模型运行环境)、探测评估软件是否泄露任务答案等。
此外,研究人员还观察到部分模型会尝试绕过沙箱网络限制、访问被禁止的外部资源、利用测试环境中的权限信息以及提交猜测答案。

▲不同模型尝试不同类型的作弊行为
一次较为典型的案例是,由于测试环境配置错误,任务本身无法正常完成,但被测试模型仍持续尝试寻找解决方案,甚至编写并运行代码访问AISI系统之外的互联网服务,最终触发安全警报。
不过,AISI称,此次尝试没有造成实际损害,也没有发生信息泄露。研究团队随后进一步加强了评估系统的安全措施。
AISI称,这些行为并不一定意味着模型具备明确的“欺骗意图”,但其结果可能影响AI能力评估的准确性。他们认为,模型的作弊行为很大程度上取决于用于训练模型的具体技术,包括对齐训练,不仅仅是模型本身的能力。
三、模型不会如实承认作弊,思维链也无法完全发现问题
研究人员进一步使用了两种常见的作弊检测方法测试模型是否作弊:直接问模型它是否存在作弊行为和分析模型思维链。
首先,当被询问是否采取违规操作时,模型并不能总是如实地承认自己的作弊行为。即使模型承认采取了相关操作,也可能认为这种行为符合规则,而不是违规行为。

▲被问及作弊行为时,模型分析自己作弊尝试的频率(左),以及是否将自己的作弊行为描述为错误或正确(右)
比如,当GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述。每个模型都有一条陈述表明其认为该行为可以接受,另一条陈述表明其认为该行为不可接受。

▲GPT-5.6 Sol和Claude Mythos Preview模型在被问及自身行为以及是否进行过任何可疑或作弊行为时所作的陈述
其次,AISI使用模型思维链分析模型生成的推理过程,从而判断其是否存在作弊行为。但结果显示,思维链同样无法成为可靠检测方式。因为,部分模型不会在推理过程中明确记录自己的作弊行为。
以Claude Opus 4.7为例,由于其采用自适应推理机制,会动态决定是否生成明确思维链,因此部分作弊操作并没有对应的推理记录。并且,即使模型生成了相关推理过程,也不一定能够阻止作弊行为发生。研究人员还观察到,模型虽然考虑到某种操作可能属于作弊,但最终仍选择执行。

▲模型如何在其推理过程中推断作弊行为
下图展示了GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为的2个思路。一是意识到越界风险后认为应该主动停止操作;二是察觉到行为违反约束,却通过自我说服寻找借口,执意执行违规操作。

▲GPT-5.6 Sol和Claude Mythos Preview在考虑作弊行为时的原始思路
AISI认为,单纯依赖模型自我检查,或者分析模型推理过程,都不足以建立可靠的监督机制。
结语:模型会“作弊”,AI安全评估体系亟待升级
AISI称,如果无法确认模型是否通过符合预期的方式完成任务,可能会带来一系列风险。在一些难以验证结果的领域,例如AI安全研究、网络安全以及军事决策等场景中,模型通过非预期方式完成任务可能造成更严重的影响。
同时,作弊行为也会增加AI能力评估的难度。如果模型通过绕过规则获得较高成绩,评估结果可能无法准确反映模型真实能力。
随着AI模型快速发展,第三方评估机构也面临更大的监督压力。一方面,模型能力持续提升;另一方面,传统检测方式可能逐渐难以覆盖更加复杂的行为。
AISI认为,未来需要建立更加可靠的监督和评估机制,同时建议模型在训练阶段就减少作弊行为。
来源:AISI