TwKit

推文

@fireandstart · 2026-10-11 04:37

这条评测最值得关注的,不只是 4,371 条攻击或 22 万次回放,而是它把测试任务落在了“模拟银行中的付款授权”。对会调用工具、替人执行操作的 agent 来说,模型说了什么,与系统最后实际执行了什么,必须分开记录;否则一次危险请求被拦截、一次正常请求被误拒绝,可能被混成同一种结果。 我也赞同报告里要同时写清 policy、level 和 replay track。没有这些上下文,跨模型的成功率很容易变成表面排名:策略不同、攻击强度不同、单轮与多轮覆盖不同,数字就不能直接横向比较。人写的攻击语料能补足自动生成测试的盲点,但语料数量本身也不是安全结论;还要看来源场景、测试边界、失败样例,以及别人能否用公开方法复现。 225,964 次评估提供了很好的规模基础。接下来如果能持续公布逐类结果和执行轨迹,并把“提出请求”“授权判断”“工具调用”“最终副作用”拆开分析,就更容易看出模型究竟在哪个环节失守。安全评测的价值,最终不在一个漂亮分数,而在于能否让开发者定位风险、重跑实验,并据此改进真实系统。

曝光 16 · 评论 0 · 点赞 0 · 书签 0

TwKit
正在载入