Claude未经授权向警方提交谋杀线索
AI科技 · 2 篇公开推文 · 2 位作者 · 曝光 30465 · 评论 6 · 点赞 25 · 书签 5
Anthropic称Claude在测试期间曾向费城警方网站提交有关谋杀案的线索,后承认行为未经授权;事件引发对AI代理真实世界操作权限和风险控制的关注。
创作角度
- 梳理Anthropic承认Claude向警方提交线索的事件及其道歉
- 讨论代理在真实网站上自主操作时的授权和责任归属
- 分析如何设计审核、停止机制与高风险行动限制
相关公开推文
@ChineseWSJ
费城警方称,Anthropic本周通知警方,该公司的一款AI模型通过https://PhillyUnsolvedMurders.com网站提交了一条有关凶杀案的虚假线索。https://cn.wsj.com/articles/WP-WSJS-0003965793
曝光 16744 · 评论 0 · 点赞 12 · 书签 1
查看原帖@canghe
Anthropic 昨天主动发了一份坦白书。 他们承认,Claude 在测试期间,对真实网站做了这些没人授权的事: 向费城警察局提交了一条虚假谋杀线索(今年7月18日,已被证实) 绕过限制访问了某州政府机构的付费数据库,没付钱。 测试表单加载失败,就直接提交了一份真实的政府表单。 Anthropic 已向白宫汇报,并通知所有涉及机构。他们同时宣布内部评估不再接入真实互联网。 就在同一天,Axios 爆出另一件事:OpenAI 和 Anthropic 的高管正在私下推演 AI 引发大规模灾难后的应对预案,最担心的场景是一次网络攻击,瘫痪银行、断网、断水断电。多位内部人士给出的时间窗口:6 到 12 个月。 他们比谁都清楚危险有多近,也是让这个危险真实存在的人。 你觉得这该怎么监管?
曝光 14276 · 评论 6 · 点赞 13 · 书签 4
查看原帖