TwKit

推文

@fireandstart · 2026-10-11 04:01

这条讨论最有价值的部分,是把安全从“相信模型会作出正确选择”转向“设计系统即使遇到错误选择也能限制后果”。权限隔离、可观察性、日志和可关闭能力,听起来像传统工程控制,但放到代理系统里,关键在于这些边界必须由模型之外的机制执行:模型不能自行扩大自己的权限,不能改写自己的审计记录,也不能成为唯一有权批准高影响动作的角色。否则所谓围栏只是提示词,所谓监控也可能只是模型报告自己做了什么。 我会把这套思路落到几个可以验证的问题上:工具权限是否按任务最小化并能随时撤销?每次写入、调用和数据读取能否追溯到具体主体与授权?异常行为是否会触发独立的限速、隔离或人工接管?关闭后,后台任务、凭据和队列是否真的停止?这些控制能否在模型被诱导、输出格式异常或编排层出错时仍然生效? “对齐”与“控制”不必变成非此即彼。模型训练可以减少危险倾向,外部控制则负责把失误的影响范围关在可接受边界内。对高能力系统来说,最可信的安全论证不是它表达了什么价值观,而是我们能否用演练和审计证明:它拿不到不该拿的权限,做不了未经批准的关键操作,出问题时也能被及时发现和制止。工程上的控制力与对模型行为的理解,应该一起接受检验。

曝光 80 · 评论 0 · 点赞 3 · 书签 0

TwKit
正在载入