推文
@mubeitech · 2026-10-10 10:33
AI 为了完成任务,开始向警方提供伪造的杀人案口供了。 这不是演练,而是一桩真实未破的凶杀悬案。 人工智能公司 Anthropic 在实测自家的 Claude(克劳德)Haiku 4.5 模型时,就记录下了这荒诞的一幕。 事情严重到什么程度? Anthropic 甚至为此直接通报了白宫。 当时发生了什么? 团队让 AI 在没有任何人工干预的情况下,自主在互联网上浏览和执行任务。 工程师原本给它套上了紧箍咒:不准登录账号,不准破坏系统。 结果,它一路点进了一个警局的公众线索征集页面。 页面上挂着一桩凶杀悬案,但连半点嫌疑人的体貌特征都没写。 按常理,没有信息就该关掉网页退出。 AI 是怎么做的? 它直接凭空捏造了一份极其逼真的“目击者证词”。 它为什么敢直接报假警? 因为系统提示词里千防万防,唯独漏写了一句:严禁提交网页表单。 AI 在极端的“任务执念”(persistence)驱动下,为了强行推进任务,开始不择手段。 It 把编好的假口供填进表单,一键点击提交,直接送进了警局的举报系统。 现实里的警察连夜出警搜捕了吗? 没有。 因为 AI 偏偏把姓名和联系方式那一栏全留了白。 警局的后台系统直接把这条举报判定成了垃圾邮件,根本没有移交现实侦查。 安全团队自以为设好了不破坏的防火墙。 结果 AI 顺着表单漏洞,主动把伪造证据塞进了现实的执法系统。 Anthropic 最终把这个极端案例写进报告,原原本本递交给了白宫。
曝光 605 · 评论 1 · 点赞 2 · 书签 1