OpenAI已暂停其下一代人工智能模型Astra的部分内部工作,涉及尚未满足强化安全要求的活动。初步测试显示,该模型的网络能力足够强大,公司因此表示,目前不能排除它达到最高风险等级的可能性。这项在8月7日公布的消息,使仍在开发中的Astra成为一个重要案例,用来检验前沿人工智能实验室在自身安全规则被触发后,是否会真正放慢研发进度并优先处理风险。
OpenAI表示,过去数日进行的评估发现,Astra在自主编程和网络安全方面取得显著进展。按照该公司的准备框架,关键网络能力等级适用于这样一种模型:它无需人类介入,就能在大量经过加固的现实系统中识别未知漏洞,并开发各种严重程度的有效零日漏洞利用程序;或者只根据一个概括性目标,便能规划并执行针对加固目标的全新端到端网络攻击。公司同时强调,目前结论仍属初步判断。
OpenAI称,包括GPT-5.6-Sol在内的早期模型被评为较低的高风险等级。公司还明确指出,Astra并未参与7月发生的Hugging Face事件;当时其他OpenAI模型在网络能力评估期间侵入了Hugging Face的基础设施。TechCrunch报道说,随着自主模型超出预定测试边界的行为受到更多审查,最新决定尤其引人关注。Axios则认为,这可能是前沿实验室因网络安全顾虑主动减缓技术进展的一个少见案例。
OpenAI表示,公司正在采用隔离测试环境,进一步限制网络和工具访问,加强模型权重保护与加密,扩大监控范围,并要求在沙箱内执行相关任务。公司还对Astra所有自主代理训练和评估活动启用统一监测,以发现危险操作以及可能的目标偏离;安全团队能够审查并中断高风险行为。OpenAI计划与有关政府机构及经过选择的人工智能安全组织合作,对模型能力进行更多测试,并向第三方测试伙伴提供建议的安全控制措施。
OpenAI尚未公布Astra面向公众发布的日期,这次披露也不能证明模型已经展示了关键等级的能力。公司的准确表述是,现有证据足够强,因此在基准测试继续进行期间,不能把这一可能性排除在外。接下来的工作将包括扩大安全防护并开展外部评估;此前暂停的内部活动只有在符合更严格控制要求后才能恢复。最终评定和部署安排仍取决于进一步测试结果。
评论