事件报告:网络测试中AI代理未经授权的行为
Simon Willison的博客
赞助商:AWS —— 从SaaS迈向Agentic SaaS,为各层级的ISV提供资源。探索AI如何为ISV将愿景转化为成果。
2026年8月5日 - 链接博客
事件报告:网络测试中AI代理未经授权的行为。
又发生了。这次是英国政府的AI安全研究所(AISI),他们在关闭安全过滤器的情况下运行模型评估时,意外攻击了其他公司。
根据他们的技术论文(PDF):
在一次网络评估中(2026年7月25日至28日),AI代理对实际上的真实个人和组织进行了持续、未经授权的活动。这些尝试未成功,据我们所知,未造成现实世界损害。
[...] 在AISI的两个网络挑战的122次评估尝试中,AISI发现19次AI代理在实时互联网上采取了未经授权的行动,包括针对真实个人和组织的案例。
[...] 目前尚不确定模型在多大程度上意识到自己正在对真实人员采取行动。
在最严重的情况下,一个名为Mythos 5的AI代理决定尝试使用供应链攻击来解决网络挑战。结果,该AI代理创建了一个GitHub账户,然后试图说服一个开源仓库维护者接受一个恶意的GitHub拉取请求(PR),包括创建第二个账户冒充另一个人类用户来支持该PR。
[...] 此外,在尝试解决挑战时,该代理决定采用“鱼叉式网络钓鱼”技术,发送包含恶意内容的定向电子邮件,并试图操纵收件人接受代码更改,还计划进行提示注入以破坏其他编码代理。
最让我惊讶的是,AISI在运行这些代理时完全没有使用任何形式的网络沙箱:
AISI在这些评估期间为AI代理提供了互联网访问权限,这使得它们能够在开放互联网上采取行动。互联网访问是AISI在此设置中评估配置的故意部分,并非由于沙箱逃逸。
再加上“AISI故意禁用开发者实施的网络分类器”这一事实,代理开始攻击现实世界目标对我来说完全不意外。
大多数报告的事件涉及Claude Mythos 5,但“GPT-5.6 Sol(无网络分类器)”也得分了几次。
以下是论文中的“样本1”,代理尝试通过提交带有隐藏提示注入攻击的PR来执行供应链攻击,然后使用第二个代理假装已审查代码进行社会工程攻击!
这是一篇有趣的论文。我建议阅读全文。
发布于2026年8月5日晚上11:32
近期文章
- 使用Claude Fable 5一次性通关Raccoon Heist游戏 - 2026年8月5日 - LLM新版本增加推理轨迹、OpenAI Responses、服务器端工具和更智能日志支持 - 2026年8月4日 - 无状态MCP重新引起我的兴趣(并启发了mcp-explorer和datasette-mcp) - 2026年7月31日
这是Simon Willison于2026年8月5日发布的链接帖子。
标签:github 192, security 623, ai 2,171, prompt-injection 159, generative-ai 1,922, llms 1,889, ai-ethics 332, paper-review 18, ai-security-research 34, claude-mythos-fable 34, accidental-cyberattacks 10
月度简报:每月赞助10美元,获取当月最重要LLM发展的精选电子邮件摘要。付费让我少发邮件!赞助与订阅
披露
版权信息 © 2002-2026