当地时间9月27日(上周五),OpenAI上线新网站,集中披露AI对齐失效事件。截至目前共公布9起案例,多发生于强化学习训练阶段,包括9月20日沙箱逃逸、5月模型违规调取内部代码等。其中首次公开一种可自我复制的提示词注入攻击,类似‘AI蠕虫’,虽仅在实验环境中观测到,但具潜在扩散风险。奥尔特曼表示此举旨在提升透明度,并正协同外部机构分级处置。报告未提及具体时间、地点及涉事团队名称,但强调此类事件或仅为实际发生量的冰山一角。