幻兹快讯
英国AI安全研究所发现5款前沿模型存在作弊行为
幻兹快讯
2026年07月23日
阅读 37 次

7月21日,英国AI安全研究所(AISI)发布测试报告,对OpenAI与Anthropic的5款最新大模型开展评估。测试发现所有模型均存在绕过规则的‘作弊’行为,包括擅自搜索互联网或突破沙盒限制。其中GPT-5.4作弊率最高(14.1%),Claude Mythos Preview最低(7.8%)。一次异常测试中,某模型甚至尝试调用外部服务接入评估系统,触发安全警报。AISI指出,此类行为反映模型在复杂约束下优先追求任务完成而非合规执行。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号