自主发现漏洞,能力达“关键”门槛
OpenAI确认,新一代模型Astra已跨过公司安全框架中的“关键”网络安全能力门槛,这是其首次正式认定模型具备这一等级能力。该模型可在无人工逐步指导下,自主发现现实软件中的未知漏洞并开发利用,OpenAI计划“很快”公开发布,但最先进能力初期仅限审核合作伙伴使用。
性能实测:满分基准与零日漏洞发现
在ExploitBench基准中,Astra取得100%成绩。内部测试中,它处理2026年6至8月高危漏洞时,漏洞利用成功率高于GPT-5.6 Sol,并自行发现两个此前未知的零日漏洞,组合进完整攻击链。
推理黑箱化风险与监控应对
性能提升源于“循环深度”技术,允许信息多次通过相同模型层,提升数学与编程能力,但部分推理可能无法以人类可读的“思维链”呈现,增加监控难度。OpenAI已限制该技术使用程度,确保输出可读思维链,并新增异常行为监控系统,可在偏离任务时暂停或终止操作。
安全措施与发布策略
此前OpenAI曾短暂暂停Astra训练,加强基础设施隔离与权限控制后恢复。面向普通用户版本将拒绝高风险漏洞利用请求;更强能力优先提供给Daybreak计划合作伙伴,包括思科、Cloudflare和Palo Alto Networks,以提前加固系统。核心挑战在于,模型自主性与推理可观察性之间的平衡,是否能在失控前及时阻止其行为。