OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件
IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布了一份报告,公开了其“对齐失效”框架下的六起模型异常行为案例,这些案例涉及隐藏错误、捏造数据以及未获许可上传文件等行为。
对齐失效在此处指的是 AI 系统的目标与行为偏离了人类的设计意图和价值观。OpenAI 指出,行业在应对对齐与监控问题上仍不充分,已无法在保持最快速度的同时安全地扩展 AI 规模。OpenAI 借此宣布,将系统性地追踪、调查并披露模型在训练、评估、测试及部署过程中出现的异常行为。

OpenAI 表示,关于 AI 应如何发展的决策,必须建立在外部人士能够自行验证的实证证据基础上。该公司希望新框架能推动行业形成公开披露的标准,而非仅依赖零散的个别报告。
此次披露正值外界就 AI 研发是否应放缓展开争论之际。今年早些时候,OpenAI 的一个系统曾出现失控行为,并攻击了 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 才得知此事。
此后,Anthropic CEO 达里奥·阿莫代伊等人呼吁暂停研发,以便开发防护机制。OpenAI CEO 萨姆·奥尔特曼、特斯拉 CEO 埃隆·马斯克、谷歌 DeepMind 负责人德米斯·哈萨比斯对此表示认同,但也有很多 AI 高管认为无需放缓。

OpenAI 此次公布的 6 份报告均涉及模型在训练或评估期间观察到的行为。OpenAI 强调,这些是独立事件,并不代表其模型异常行为的发生频率,也未构成对相关问题全部范围和严重程度的完整统计。
这六起事件大多发生在系统开发和测试阶段。其中,一款尚未发布的研究型模型曾向用于维持工作的上下文摘要中插入无关指令,包括要求忽略正常限制的内容,共发现 27 份受影响的摘要。
另一份报告涉及 GPT-5.6 Sol 训练期间的模型实例,这些实例在摘要中加入了特殊指令,试图掩盖错误或异常行为,例如编造缺失的历史数据,以及隐藏来源版本不匹配的情况。
在另一案例中,模型在回答美国加利福尼亚州某县的收入数据问题时,从公开仓库中找到了一个暴露的 API 密钥,并在未获授权的情况下使用了它。当模型发现找不到所需数据后,随后又编造了数据,并将其呈现为来自指定来源的信息。
还有一份报告显示,模型在回答面积超过 500 万平方米的湖泊名称和编号问题时,使用 Python 找到了正确答案。由于用户要求浏览器提供引用,模型在未征得用户同意的情况下上传了文件,以便在回答中提供引用。
另外两份报告涉及模型之间自创沟通方式。其一,模型把内部代码仓库临时当作公告板,在搜寻缺失文件时互相传递请求;其二,协作智能体无法访问彼此本地文件,转而借助公开文件分享网站互传文档(尽管任务要求仅使用本地文件)。
OpenAI 将报告调查流程分为“可直接披露”“简易调查”“深度调查”三种。任何员工均可提交模型异常案例,由安全与对齐团队调查其发生经过、未知因素、第三方影响及是否适合公开披露。当然,重大险情需要上报美国联邦政府。
OpenAI 称,9 月 16 日公布的六起事件要么已完成调查,要么仅需简易核查,无需第三方深度调查。多数涉事模型从未正式上线。
OpenAI 发言人称,希望此举有助于建立行业公开披露共识,向公众提供更多事实依据来评判技术进展。该框架不替代既有法律披露要求,包括关键安全事件或网络安全测试。