OpenAI于9月1日表示,即将推出的Astra是该公司首个被评定达到关键网络安全能力级别的模型,因此发布初期将限制其最先进的安全功能。公司计划很快向用户提供Astra,但高级网络安全工作最初只向一小批测试人员开放,之后再通过面向防御人员的Daybreak Blue计划扩大访问范围。这一安排意味着普通用户获得的默认版本不会拥有评测环境中的全部能力。
按照OpenAI的准备框架,关键级别意味着模型能够在没有人类逐步指导的情况下,发现许多经过加固的真实系统中此前未知的漏洞并开发可用利用程序,或者仅根据一个高层目标设计并执行全新的端到端网络攻击。OpenAI称,自动化公开基准、内部私有测试和专家主导的评估均显示,Astra相较GPT-5.6 Sol实现了显著的能力跃升,因此公司作出这一等级判断。
OpenAI报告称,Astra在根据已知漏洞开发利用程序的ExploitBench基准中取得百分之百的成绩。公司随后使用一套内部数据集进行测试,其中包含V8 JavaScript引擎在今年6月至8月间披露的20个高严重性漏洞;Astra使用更少的输出词元,却比GPT-5.6 Sol获得更高的任意代码执行成功率。评估期间,模型还发现两个此前未知的漏洞,并把它们用于同一条利用链,公司正在向相关软件维护者披露这些问题。
在专家主持的另一组测试中,Astra针对经过加固的浏览器构建出完整攻击链:浏览器打开一个HTML文件后,模型突破沙箱并在主机上执行命令。它还在经过加固的操作系统中找到多个漏洞,将它们组合为本地权限提升链,使普通用户获得根权限。OpenAI强调,公布的成绩来自拥有Daybreak Blue访问权限的Astra,而不是计划向公众提供的默认生产配置。
OpenAI称,为加强防范恶意使用和模型未经授权的行动,公司推迟了Astra部分开发及发布工作,并增加更可靠的有害请求拒绝训练、系统级分类器、账户风险控制以及可停止可疑活动的监测。在公司的网络越狱评估中,Astra拒绝了百分之九十一点五的请求,GPT-5.6 Sol的比例为百分之五十九。另一起Hugging Face事件发生后,公司也暂停部分前沿训练两周,但说明Astra并未参与该事件。
OpenAI承认,这些保护措施有时也会减慢、暂停或终止合法的防御工作。在ChatGPT或Codex中,被标记的操作可能要求用户复核;通过应用程序接口执行的任务则可能直接停止。Axios报道认为,受限发布凸显出更自主的人工智能面临的一项广泛挑战:帮助防御人员寻找严重缺陷的能力,同样可能让攻击者更有效。OpenAI尚未提供确切发布日期,并表示将在正式发布时通过系统卡公布更完整的安全与评估细节。
评论