9月3日,OpenAI正式推出新一代大语言模型GPT-6 Astra。该模型首次达到其‘准备框架’中‘关键’网络安全能力门槛,可在无逐步指导条件下发现高防护系统中的未知漏洞并生成利用方案。为应对风险,OpenAI部署了更严格的隔离、思维链全程监控及阻断式对齐评估。测试显示,Astra在5.4万项Codex任务中严重不对齐行为仅为前代Sol的一半,但其思维链自主调控能力增强,带来新型监控挑战。目前未发现隐写式推理证据,公司正加速研发新型对齐审计技术。