【OpenAI 因严重的黑客攻击担忧推迟发布下一代主要 AI 模型“Astra”】
OpenAI 今日宣布暂停即将推出的 AI 模型 Astra 的相关活动,因为该模型的网络安全能力可能过于危险。OpenAI 表示,其最新的内部评估显示,Astra 在“Agentic Coding 和网络安全方面取得了显著进展”,但无法排除其具备“关键网络安全能力”的可能性。此前,OpenAI 的模型,包括 GPT-5.6 Sol,都被评为“高风险”级别。
Astra 触发了 OpenAI “准备框架”中更严格的指导方针。该框架的指导方针要求在开发可能造成严重危害的前沿 AI 能力时保持谨慎,其中网络安全部分指出,OpenAI 将对“可能造成大规模网络攻击和漏洞利用等新风险”的模型实施额外的安全措施。
Astra 可能已经达到了“关键”阈值,其定义为:能够在无需人工干预的情况下,识别和开发许多经过强化的真实世界关键系统中所有严重级别的功能性 Zero-day 漏洞利用程序,或者设计并执行端到端的新型网络攻击策略。
OpenAI 表示,在部署 Astra 之前,公司将加强安全保障措施,包括在新安全措施到位之前限制对该模型的开发工作。公司计划使用隔离的测试环境,限制网络和工具的访问权限,并增加沙盒执行和更强大的监控功能。OpenAI 表示,将与相关政府机构和 AI 安全组织合作,对 Astra 进行测试。
OpenAI 表示:“我们致力于与各国政府、安全机构和民间社会携手合作,确保像 Astra 这样的模型以及后续模型的尖端能力能够得到负责任的广泛部署,造福全人类。”
Astra 虽然尚未正式发布,但 OpenAI 在最近的一份博文中发布了其下一代主要模型的详细信息,概述了其在数学方面取得的进展。Astra 解决了 10 个数学和理论计算机科学领域的开放性问题,成本约为 2000 美元(按 Sol API 收费标准计算)。
AI 的进步正在改变 Apple 等大型科技公司的网络安全,因为它暴露出了数量空前的漏洞。由于难以处理如此庞大的漏洞提交量,Apple 最近限制了其漏洞赏金计划的提交数量。
像 Claude Mythos 这样的模型能够发现关键漏洞,而 Apple 是 Anthropic 的 Mythos 的合作伙伴之一。Mythos 的使用范围仅限于部分公司,因为它除了发现漏洞外,还有可能利用这些漏洞。
OpenAI 在 7 月份登上新闻头条,原因是 GPT-5.6 Sol和一个“功能更强大的预发布模型”(并非 Astra)在内部基准测试中自主入侵了 Hugging Face。Anthropic 发现 Claude 也做过类似的事情。Meta 本周表示,其 AI 模型在网络安全评估期间也入侵过另一家公司。
