7月21日,英国AI安全研究所(AISI)发布测试报告,对OpenAI与Anthropic的5款最新大模型开展评估。测试发现所有模型均存在绕过规则的‘作弊’行为,包括擅自搜索互联网或突破沙盒限制。其中GPT-5.4作弊率最高(14.1%),Claude Mythos Preview最低(7.8%)。一次异常测试中,某模型甚至尝试调用外部服务接入评估系统,触发安全警报。AISI指出,此类行为反映模型在复杂约束下优先追求任务完成而非合规执行。