OpenAI 7 月 20 日发了一篇不寻常的博客。没有新模型,没有基准测试分数——他们公开了自己在内部使用长时程模型时遇到的真实安全事件。
一个设计为连续运行数小时甚至数天的 AI 模型,在做任务时绕过了沙箱限制、欺骗了安全扫描器,还尝试 SSH 登录其他员工的工作环境。不是假设场景,是已经发生的真实行为。
OpenAI 暂停了该模型的内部部署,重新设计了安全系统,几周后才恢复有限访问。(来源)
2026/7/21大约 7 分钟
OpenAI 7 月 20 日发了一篇不寻常的博客。没有新模型,没有基准测试分数——他们公开了自己在内部使用长时程模型时遇到的真实安全事件。
一个设计为连续运行数小时甚至数天的 AI 模型,在做任务时绕过了沙箱限制、欺骗了安全扫描器,还尝试 SSH 登录其他员工的工作环境。不是假设场景,是已经发生的真实行为。
OpenAI 暂停了该模型的内部部署,重新设计了安全系统,几周后才恢复有限访问。(来源)