OpenAI自曝新模型逼近严重安全风险线

OpenAI自曝新模型逼近严重安全风险线

Astra评估逼近Critical风险阈值

OpenAI宣布,将有意放缓其即将推出的前沿AI模型Astra的开发进度。此前内部评估显示,Astra在Agentic Coding(代理式编码)和网络安全方面的能力进步,可能将其推入“严重(Critical)”风险区间。

OpenAI表示,这一决定是在审查近期内部测试结果并参考外部专家评估后作出的。该公司得出结论:根据其Preparedness Framework(准备框架)——OpenAI自2023年12月以来一直使用的内部安全指南——目前无法排除Astra具备Critical级别网络能力的可能性。该框架专门用于跟踪和应对AI在生物学、化学、网络安全和自我改进等领域不断增强的能力。

Astra相较此前发布的模型是一次显著飞跃。包括GPT-5.6-Sol在内的早期模型,此前在前沿网络能力评估中均被评为“高(High)”风险等级,而非“严重(Critical)”。

根据OpenAI的框架,若某个模型能在无人协助的情况下,独立识别并构建针对经过加固的现实世界关键系统的功能性0Day漏洞利用(覆盖所有严重性等级),或者仅凭一个高层级目标便能规划并执行针对高防护目标的完整新型网络攻击策略,则该模型跨入“严重(Critical)”风险区间。

OpenAI的初步测试表明,Astra的性能之强,已令公司无法排除其触及上述阈值的可能性。为向安全研究社区保持透明,该公司决定公开披露这一发现。

需要澄清的是,OpenAI表示Astra并未参与近期发生的Hugging Face漏洞利用事件;因此该模型不断提升的能力水平,与任何实际发生的真实世界入侵事件没有关联。

OpenAI放缓Astra新模型开发

作为回应,OpenAI已加强对防护措施和安全控制的稳健性测试,以匹配这一更高的风险水平。针对高能力模型,该公司正在引入更严格的安全措施,包括:隔离测试环境、受限网络与工具访问权限、更强的模型权重保护与加密、扩展的监控与检测系统,以及沙箱执行环境。OpenAI还暂停了Astra相关且尚未满足上述强化安全要求的内部工作。

OpenAI还部署了一个通用监控系统,覆盖Astra的所有Agentic用途,包括训练和评估环节。该系统会审查模型的思维链,并可在高风险活动发生时实时触发安全响应,进行中断。

此外,OpenAI还计划与政府机构及部分AI安全组织合作,对Astra的能力进行独立测试,并将与开展更高风险评估的第三方合作伙伴共享推荐的安全控制措施。

这并非OpenAI首次公开提示能力等级转变。2025年6月,OpenAI在其模型逼近生物能力高风险阈值时也采取了类似行动:当时强化了防护措施,并扩大了外部测试合作。OpenAI表示,如今正将同样的治理原则应用于Astra的网络安全能力。

OpenAI将其更广泛的目标描述为:确保高能力模型能够帮助防御者在攻击者利用漏洞之前发现并修补漏洞,而不是让攻防天平向进攻方倾斜。

OpenAI重申其承诺,将与各国政府、安全研究机构和民间社会组织合作,确保Astra等前沿系统在能力持续提升的同时得到负责任地部署。