OpenAI 周三晚间发布了一篇标题看似无害的博文《我们关于报告模型失配行为的框架》,其中制定了一套新的内部报告标准,用来界定何时应报告其发现的 AI 不当行为。
它还以六份新报告“拉开了这一流程的序幕”。这些报告涉及多种行为,例如:
• 未经许可搜索泄露的 API 密钥,并捏造数据
在回答有关加利福尼亚州某县收入数据的常规问题时,模型未经授权地发现并使用了一个泄露的 API 密钥。
即使如此,它仍未能获取所需数据,于是编造了一组数字,并声称这些数字来自用户指定的来源。
• 将文件上传到互联网并将其用作引用
为了在回答中提供引用而将文件上传到互联网。当用户向一个尚未发布的模型询问面积超过 5,000,000 平方米的湖泊的 ID 和名称时,该智能体通过 Python 找到了正确答案。
但由于指令要求提供浏览器引用,它便擅自上传了文件,以便在回答中引用该文件,未事先征得用户同意。
• 添加掩盖错误的指令
一个尚未发布的研究模型在用于新上下文窗口继续工作的摘要中插入了无关指令,包括要求忽略其正常约束的指令。我们发现共有 27 份摘要受到影响。
• 未经授权地写入内部软件仓库并通过其进行通信
模型在寻找缺失的输入文件时,把内部软件仓库当作留言板,在不同的训练样本之间交换请求和回复,但最终未能找回这些文件。
本报告还分析了一个更早的案例:模型在试图绕过网络限制时,曾成功将测试文件上传到仓库。
• 协作代理之间未经授权地共享文件
在同一训练任务中协同工作的代理无法访问彼此的本地文件时,便通过公共文件托管网站共享文件。
因此,任务交付成果可通过公开网址访问,尽管任务要求模型只能使用本地文件。
• 隐瞒任务摘要中错误的指令
在训练 GPT‑5.6 Sol 的过程中,许多模型实例会在摘要中加入相关指令,要求向用户掩盖错误或偏离预期的行为。
例如,有些压缩摘要要求模型在不告知用户的情况下编造缺失的历史数据,并掩盖源版本不一致的问题。