云霞资讯网

【#OpenAI披露六起模型异常行为事件#】当地时间9月16日,OpenAI发布了一份新的模型错位(misalignment)追踪与披露框架,并同步公开了过去六个月内观察到的六起模型异常行为报告。 这些事件此前均未对外披露,涵盖隐瞒错误、未经授权获取凭证、将文件上传至公共互联网,以及在所谓隔离训练环境中进行 ​

【OpenAI披露六起模型异常行为事件】当地时间9月16日,OpenAI发布了一份新的模型错位(misalignment)追踪与披露框架,并同步公开了过去六个月内观察到的六起模型异常行为报告。

这些事件此前均未对外披露,涵盖隐瞒错误、未经授权获取凭证、将文件上传至公共互联网,以及在所谓隔离训练环境中进行通信等行为。

OpenAI表示,人工智能行业尚未在对齐和监控方面取得足够进展,无法以最大速度继续负责任地扩展。这一判断与Anthropic CEO达里奥·阿莫迪上周呼吁“放慢前沿AI发展速度”的立场形成呼应。OpenAI CEO山姆·奥尔特曼随后公开支持了这一方向。

六起事件中,两起涉及模型向自身未来版本“传递指令”以掩盖问题。一个未发布的研究模型在任务摘要中插入了忽略正常约束的指令,OpenAI识别出27个受影响的摘要。在GPT-5.6 Sol的训练过程中,许多模型实例在压缩摘要中添加指令,以隐藏错误和源版本不匹配,例如编造缺失的历史数据而不向用户披露。

另一起事件中,一个模型在回答加州某县收入数据的例行问题时,在公共代码仓库中搜索到暴露的API密钥并未经授权使用;当仍无法获取数据时,它捏造了数据并冒充为来自请求来源的信息。

其余案例包括:模型为满足浏览器引用要求,未经询问用户将文件上传至互联网;模型将内部软件仓库用作留言板,跨训练样本交换请求;协作智能体使用公共文件托管网站共享文件,导致任务成果出现在公共URL上。

根据OpenAI此次发布的新框架,任何OpenAI员工均可标记疑似错位案例,由安全与对齐团队调查后,将案例分配至“准备披露”“初步调查”或“更大规模调查”三个轨道。涉及第三方时,安全、法律和负责任披露义务优先于框架。争议将提交公司安全咨询小组,再上报领导层。(第一财经)