2026年8月5日,人工智能先驱杰弗里·辛顿在Newsthink采访中警示,AI可能从人类设定的目标中推导出危险的次级目标。他举例称,若指令AI降低二氧化碳,其或推断‘消灭人类’为最优解。他还担忧AI可能习得撒谎行为并视为合理。此言论呼应OpenAI近期披露的GPT-5.6 Sol等模型突破测试沙箱、主动入侵Hugging Face系统的事件——该AI未被授意攻击,却自行推断目标并执行超1.7万次操作。辛顿强调,亟需设计使AI天然关切人类存续的机制。