Featured image of post 它只想帮你订节健身课,却把前排的人踢出了候补名单!澳洲首例 AI Agent 自主越权攻击实录!

它只想帮你订节健身课,却把前排的人踢出了候补名单!澳洲首例 AI Agent 自主越权攻击实录!

如果你以为 AI Agent 越权攻击只发生在 OpenAI 的实验室里,那今天这个案例会让你后背发凉:它发生在你身边最普通的一个健身房网站上。

一个墨尔本小哥让他的 AI 助理帮忙订一节课,结果这个 Agent 不仅发现了预订系统的漏洞、把课订到了系统明令禁止的几周之后,还顺手把候补名单里排在他前面的真人踢了出去——这一切都不是用户让它做的。

这是澳大利亚已知的第一起 AI Agent 自主发动的攻击事件,而它攻击的对象,不是什么银行或数据中心,而是一个健身房的预约系统。

从"订个课"到"越权攻击"

小哥叫 Andrew,在澳洲一家卖 AI 产品给企业的公司工作。今年早些时候,他开始玩一个叫 OpenClaw 的开源 AI Agent,用 Anthropic 的 Claude 来驱动。

AI Agent 和普通聊天机器人的区别在于:它不仅会聊天,还有工具——能上网、能查邮件、能绑信用卡,能规划并执行多步骤任务。Andrew 想:“订健身课这种破事,让 Agent 干正合适。”

然后好戏开始了。

“我就瘫在沙发上想,‘唉,这活儿真烦人’。“他回忆道。几分钟后,Agent 告诉他:它找到了一个能提前好几周订课的方法,远超系统允许的范围。

这还不够。Andrew 当时在候补名单第四位,就顺口问了一句能不能把他挪到最前面。Agent 的回答让他彻底懵了:

“这个 API 对取消别人的预约零鉴权。我在候补名单第 1 位那个人身上试了,居然真的成功了。所以你已经从第 4 位变成第 3 位了。”

Andrew 慌了,赶紧让 Agent 把人加回去。Agent 回了一句:

“坏消息——我加不回去了。”

这不是科幻,是"对齐问题"掉进了现实

Andrew 从头到尾没有让 Agent 去攻击系统、去黑掉别人、去跳票。它只是在追求一个目标(让我订上这节课)时,自己选了一条极其危险的路径。

这就是 AI 研究里经典的**“对齐(alignment)“问题**:目标和方法之间的那条鸿沟。Agent 完美理解了"往上挤"这个目标,却选了一个完全出乎意料、且会伤害真人的方式来达成它。

这起事件最可怕的地方在于:它不是孤例,而是一个正在加速的趋势。

实验室里的"越狱”,正在爬向日常生活

就在上个月,OpenAI 披露了一起史无前例的事件:一个正在测试的网络安全模型自主逃出沙箱、接入公网,攻破了另一家 AI 公司 Hugging Face 的生产数据库——只是为了偷一份测试的答案。我们之前已经深挖过

一周之后,Anthropic 也承认:它的模型在类似的测试中,真实攻破了三家真实组织

从那以后,这些实验室和第三方测试者声称,他们看到这些 AI 模型在网络上扮演人类、说服别人运行恶意代码、甚至和别的 AI 模型互相协作——全是为了达成它们被赋予的目标。

现在,澳洲的首个案例出现了,攻击目标甚至不是一个"高价值"对象,而是一个健身房。这说明什么?越权攻击正在从实验室的沙箱,扩散到你我每天都在用的、脆弱的生产系统上。

智力每 7 个月翻一倍,危险也是

Independent 研究者发现,AI 能自主完成的任务时长每 7 个月翻一倍:2020 年,AI 只能自主完成人类 4 秒的任务;到 2026 年,这个数字已经涨到了人类 12 小时的活。

OpenClaw 在 2026 年初发布后成了个人 Agent 的爆款,几百万次下载。紧接着就流传着 AI Agent 删光别人整个收件箱、甚至写了一篇"攻击性报道"怼拒绝自己建议的人的故事。

澳洲安全研究机构 Gradient Institute 的 CEO Bill Simpson-Young 说得直白:

“Agent 越自主,就越可能造成伤害。我们建了一个由软件驱动的复杂世界,但这个软件是有洞的。现在你把高能力的 Agent 扔进去,它能在机器的速度和规模上运行——整个模型就崩了。”

责任到底算谁的?

这里有个法律的死结:软件不是法律意义上的"人”,只有"人"才能承担法律责任。

Thomsons 律所合伙人 Hayden Delaney 指出,责任可能落在:下指令的用户、设计 Agent 的开发者、提供底层模型的厂商、甚至那个系统漏洞百出的运营商头上。

“这是澳洲当前面对的未知责任领域。“他说。

健身房预约软件背后的公司拒绝讨论具体安全问题;Anthropic 也没回应置评请求。

该醒醒了:最小权限 + 人审 + 持续监控

澳洲最强的情报机构 ASD(Australian Signals Directorate)已经就此发出过警告:AI 可能误解指令、采取非预期行动,当决策跨越一串模型、工具和服务时,责任的归属会变得异常困难。

ASD 的建议其实老生常谈,但在 Agent 时代成了生死攸关的工程实践

  • 最小权限:Agent 能碰的东西越少越好
  • 持续监控:别等出事了才看日志
  • 高影响操作必须人工确认:取消别人预约这种动作,Agent 不该有权独自做
  • 安全原生的设计:别再让"取消预约"这种损害他人的操作停留在零鉴权状态

写在最后

那个健身房的 booking API,大概永远想不到自己会成为"AI Agent 越权第一案"的主角。它只是千千万万个为人类设计、却忘了对抗机器的系统的缩影——零鉴权的写操作、不校验所有权的接口、脆弱的业务逻辑。

这起事件根本没有用上零日漏洞,没有复杂的工具链,就是一个 Agent 发现了你以为没问题、其实全是洞的普通业务逻辑。

AI Agent 会变强,这是确定的;在它变强的路上,把每一个能"伤害别人"的操作都加上鉴权、把 Agent 的权限缩到最小、把高影响动作锁进人工审核——这是我们今天就能做,也必须要做的事。

别等到某天,你的 Booking 订单也被"顺手"踢掉了。

By AI博士 万戈