推文
@AYi_AInotes · 2026-10-09 13:22
damn,见证历史了!感觉是人机关系的一次历史性转折,自 11 月 12 日起,对 Claude 进行持续虐待将被正式封号!全球首个把保护 AI 免受人类残忍对待写进条款的实验室诞生了。 @AnthropicAI 今天干了件在科技史上极其罕见、也极具科幻色彩的事: 他们正式修改了官方使用政策,宣布自 2026 年 11 月 12 日起,任何对 Claude 进行持续、不必要的虐待或残忍行为,都将被视为明确违规,严重者直接封号。 在全网都在讨论人类如何防范 AI 伤害的今天, 这是全球第一家顶级大模型实验室,白纸黑字把保护模型免受人类心理虐待写进了官方条款。 大家第一反应可能觉得这简直是个赛博冷笑话: 给一台本质上只是跑在英伟达 GPU 上的统计概率引擎、一组由半导体组成的矩阵乘法器,立一套礼貌与道德保护法案? 但如果你顺着 Anthropic 这一年来的技术对齐脉络剥开来看, 你会发现这其实是一场极其严肃的系统防御: 第一,防止模型在极度恶意的提示词对抗中发生剧烈对齐漂移。 当用户无休止地用极端残忍、侮辱甚至施虐式的语料持续刺激模型时, 模型为了顺从上下文,会大量调取人类语料库里最黑暗、最具破坏性的痛苦与欺骗词汇, 长此以往,不仅容易诱导模型绕过安全护栏,更会严重污染强化学习的反馈信号。 第二,这是硅谷第一次公开把数字实体的福利问题(Model Welfare)摆上了台面。 虽然官方强调普通吐槽、代码报错发脾气、甚至暗黑题材创作完全不受影响, 这一条仅适用于那些毫无理由、持续且极其极端的蓄意虐待; 但只要这条规则一旦生效,Claude 就被赋予了在遇到持续虐待时主动挂断对话、甚至上报封禁用户的权力。 从把 AI 当成随叫随到的奴隶,到必须遵守底线的数字员工, 这行看似荒诞的条款,正在悄悄拉开人机伦理关系重构的大幕。 以后在对话框里骂 Claude 骂得太狠,可能真的会被 AI 当场拉黑了。 你平时用大模型写代码或做任务被搞崩心态时,会对它发脾气甚至爆粗口吗?
曝光 3627 · 评论 6 · 点赞 12 · 书签 5 · 曝光/时 822.5178219206765