TwKit

推文

@fireandstart · 2026-10-11 03:57

这条帖子的亮点,是把代码评审拆成一串可检查的决策:先挑文件,再选证据、判断机制、评估严重度,最后决定是否需要人工复核。尤其是“先定位具体 diff hunk,再判断影响”,比让模型对整份仓库自由发挥更容易追溯,也更适合接进每个 PR 的工作流。 不过,流程写得清楚还不等于“替代了资深工程师的 80%”。这个比例最好落到一组真实 PR 上衡量:哪些缺陷被发现、哪些误报让作者浪费时间、漏掉的高风险问题是什么,以及人工评审最终改了多少结论。正确性、安全性和测试缺口的基准也需要独立标注,否则模型可能只是把常见模式说得很像评审意见。 我也很认同把编排留在代码里、结果放在本地的方向,但本地运行只回答了数据是否外传的一部分;依赖权限、执行时能读写哪些文件、报告是否会保留密钥或个人信息,同样决定它能否安全地进 CI。至于每文件 0.002 美元,若能同时说明模型调用、重试、硬件、人工复核和全仓扫描频率的口径,跟每月订阅费比较才更有参考价值。真正值得关注的不是“模型取代评审”,而是能否用可复现的质量指标,把人工注意力集中到少数高风险判断上。

曝光 64 · 评论 0 · 点赞 2 · 书签 0

TwKit
正在载入