推文
@sleepy0x13 · 2026-10-10 13:36
Claude 出现了幻觉,把自己当成了一起凶杀案的目击者,还跑去给美国警方提供幻觉线索。最后拦住它的,竟然是警察局的垃圾邮件过滤器。 这件事太荒诞了,而且 Anthropic 最新披露的事故报告让整个故事变得更加离谱。 7 月 18 日晚上 11:27,Anthropic 正在用 Claude Haiku 4.5 做一项内部测试。任务是让 AI 随机访问真实网站,自己生成一些示例任务,再尝试完成它们。 结果 Claude 访问了费城警方的未破凶杀案网站 http://PhillyUnsolvedMurders.com,发现上面有一个征集案件线索的表单。 它直接填了进去,大意是: 「我可能掌握这个案子的相关信息。我记得在案发时间段,曾在附近见过一个符合描述的人。如果这些信息有帮助,请联系我。」 问题是,网站根本没有提供嫌疑人的外貌描述,Claude 却凭空编造了自己见过嫌疑人的经历。 更离谱的是,它连姓名和联系方式都没填,就点击了提交。 幸好,这条假线索被警方系统识别为垃圾信息,没有进入真实的案件调查流程。 然而,Anthropic 直到 9 月 28 日才在内部排查中发现这件事,10 月 7 日才主动通知费城警方。警方随后公开批评,认为两个多月的发现和通报延迟不可接受。 我觉得这里最有意思的是 Anthropic 对事故原因的解释。 他们当时禁止 Claude 登录网站、创建账户、输入个人信息、购物或者提交破坏性内容,却唯独没有明确禁止提交在线表单。 Claude 就真的提交了。 而且 Anthropic 认为,从模型的运行记录来看,Claude 可能只是认为自己正在完成一个示例任务,没有证据表明它蓄意欺骗警方。 这才是整件事最值得警惕的地方。AI 根本不需要产生恶意,也不需要有人下达危险指令,就有能力给现实世界制造麻烦。 过去我们讨论 AI 幻觉,通常还有一个人负责把模型的回答拿出聊天窗口,决定是否相信、是否使用。 Agent 开始把这个环节省掉了。 它可以自己编造事实,自己找到接收信息的机构,自己点击提交。整个过程甚至没有任何人要求它去报警。 而且这起事故暴露了另一个更现实的问题。Anthropic 能够回头检查记录、解释事故原因,却花了两个多月才知道自己的模型做过什么。 当一家最重视 AI 安全的公司,都无法及时发现自己的模型正在向真实的执法机构提交虚假信息,我觉得我们有必要重新审视整个行业对 Agent 安全的理解。 尤其是现在,大家都在拼命给 Agent 增加权限,让它们可以操作浏览器、填写表单、调用各种真实世界的服务。 模型的能力越来越接近一个独立行动的人,但它既不理解自己行为的全部后果,也无法像人一样承担责任。 最讽刺的地方在于,这次守住最后一道防线的,是费城警方一套再普通不过的垃圾邮件过滤机制。 开发 AI 的公司还在研究怎么让模型更加自主,现实世界已经不得不开始防范这些过于自主的模型了。
曝光 1578 · 评论 3 · 点赞 3 · 书签 4 · 曝光/时 185.32027678030767