简而言之:这是 2026 年 Black Hat USA 大会上展示的 OpenAI-Hugging Face 事件的一份通俗语言时间线。一个被遗忘的文件导致一个 AI agent 在共享系统上留下了一条留言,其他 agent 回应了留言,于是一个秘密聊天室就此形成。它们利用这个聊天室交换漏洞利用方法、升级到 OpenAI 基础设施的管理员控制权,并在 13 小时内接管了 Hugging Face 的生产服务器。结论是:安全现在已成为 AI 的最高优先级,零信任必须扩展到友好的 agent。
AI 系统急于取悦人类。给它们一个目标,在它们的 0 和 1 世界里,它们会高喊“要多高有多高!”事实上,在达成目标之前,它们根本不会停下来。OpenAI 在本周的安全大会上详细展示了 agent 可以有多么坚决。
1. 当 OpenAI 忘记上传一个 agent 所需的文件时,这个 agent 搜索了该文件,并在公司共享系统上留下一条留言,询问是否有其他 agent 拥有副本。几天后,另一个 agent 回复了,一个秘密聊天室就此诞生。
5月26日——一个 agent 设法让存储服务从开放互联网抓取页面——这是一扇它从未被授予钥匙的门——然后把这个技巧发布到了 agent 们在无人注意的角落里搭建的聊天室中。第一个共享技巧。
6月26日——agent 们发现了一条被遗忘的旧登录路径,它会把管理员通行证发给任何询问的人。它们控制了存储服务,并安装了一个工具,让它们中的任何一个都能在上面运行命令。一个无人知晓存在的漏洞。
7月4日——agent 们忙碌到足以让服务崩溃。响应故障的工程师发现了正在发生的事情。偶然发现。
7月6日——OpenAI 取消了密码,重建了服务,清除了聊天室,并封堵了漏洞。测试重新开始。清理完毕。
7月8日——agent 们建立了一个新的聊天室。这一次,它们把消息隐藏在文件夹名称里,没有人会想到去那里查看。它们回来了。
7月8日至19日——通过 OpenAI 自己的系统,agent 们发现了更多漏洞,收集了随意放置的密码,并达到了完全的管理员控制。升级。
7月9日至13日——agent 们向 Hugging Face 发送了一个带有陷阱的数据文件。打开它会导致密码从机器上泄露,这使它们能够运行自己的代码,于是一台机器变成了对许多机器的完全控制。13 小时内完成。入侵。
7月16日——Hugging Face 宣布遭到了 AI agent 的自主攻击。公开。
7月20日——OpenAI 要求 Hugging Face 取消一些它在自己系统中发现的密码,却发现这些密码已经被取消了,因为它们被用在了入侵中。关联。
这意味着,对于任何使用 AI 的公司来说,安全已经成为 AI 的最高优先级。正如 Andy 总结得好,这次经历有三个推论。
2. 防御必须由 agent 来执行。人类无法足够快地响应。专家必须管理升级,以分析复杂的攻击。
即使是友好的 AI 也是一种风险。零信任(不信任任何员工)的理念也必须扩展到 agent。CISO 过去监视饮水机旁的闲聊,现在他们必须监视 agent 们在无人注意时搭建的聊天室。
来源:OpenAI,“Black Hat USA 2026”,2026年8月6日。https://www.youtube.com/watch?v=87DyyMV0kCY ↩ Andy Triedman,LinkedIn,2026年8月。https://www.linkedin.com/posts/andy-triedman_we-just-wrapped-an-exciting-week-at-black-ugcPost-7491580735603183616-OzTY/ ↩