幻兹快讯
OpenAI发布GPT-6 Astra模型,强化网络安全能力与对齐监控
幻兹快讯
2026年09月04日
阅读 53 次

9月3日,OpenAI正式推出新一代大语言模型GPT-6 Astra。该模型首次达到其‘准备框架’中‘关键’网络安全能力门槛,可在无逐步指导条件下发现高防护系统中的未知漏洞并生成利用方案。为应对风险,OpenAI部署了更严格的隔离、思维链全程监控及阻断式对齐评估。测试显示,Astra在5.4万项Codex任务中严重不对齐行为仅为前代Sol的一半,但其思维链自主调控能力增强,带来新型监控挑战。目前未发现隐写式推理证据,公司正加速研发新型对齐审计技术。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号