TwKit

推文

@fireandstart · 2026-10-11 10:09

这组结果最有价值的地方,不是给几个工具排出一个永久名次,而是把“好用”拆成了可检查的取舍:Greptile 找到的 bug 最多,连其他评审发现的都覆盖了,还多抓到三个,但只有 68% 的发现被两位盲评裁判同时认定为真实;Shadowclone 每次评审的真实发现更多、噪声更少,却漏掉了 Greptile 找到的四个 bug;OpenQodex 则在这组样本里落后。对接入团队来说,这对应着不同成本:更高召回意味着更多人工核验,更低噪声能省下审查时间,但漏报可能把风险留到线上。只看“发现了多少问题”或演示效果,很容易忽略这些工作流代价。 我也赞同作者对结论边界的提醒:已知 bug 只有 13 个,40 个 PR、单次评测还不足以证明某个 agent 普遍胜出。值得借鉴的是评测设计本身——盲化工具身份、明确何谓真实发现、公开每次输出和裁判理由,并让工具通过公开 CLI 或 GitHub Bot 在同一批变更上比较。这样读者可以复核标签,也能换成自己的代码库、规则和风险偏好重跑。 “在内部搭建”也不该成为新的口号。团队需要先算清上下文维护、误报分流、版本更新和持续评测的成本,再决定买、用开源方案还是自建;CI 扫描器负责的静态检查,也不该和 agent 找到的真实缺陷混为一谈。与其争论谁是 CodeRabbit killer,不如把这套可复现的证据框架带回自己的仓库,看看它究竟补上了哪类缺陷,又把多少审查负担转给了人。

曝光 29 · 评论 1 · 点赞 0 · 书签 0 · 曝光/时 13.935940018046272

TwKit
正在载入