【代码评审是选“便宜大碗”还是“贵得有理”?】最新的行业评测显示,GPT-5.6 Luna虽然比GPT-6 Astra便宜28倍,但在安全性审计上几乎腰斩,且每四条建议就有一条是废话。Luna能处理基础逻辑,但在涉及权限校验等复杂上下文时,它看不见那些“没写出来的漏洞”。目前行业分歧在于:是让AI直接往PR里塞评论,还是让它作为开发者的私人助手。这不再是Token成本的算术题,而是研发效能的博弈。廉价模型的“幻觉噪音”会迅速耗尽开发者的耐心,导致真正的风险被掩盖。未来的标准配置或许不再是单一模型,而是分层治理:用轻量模型跑基础检查,用顶级模型盯防核心逻辑。最关键的禁忌是:绝不要把未经人类筛选的AI输出直接倒进协作流,那不是在帮同事,而是在制造信息垃圾。当AI开始生成代码,唯一能规模化应对的只有AI评审,但人类必须守住最后一道过滤网。
发布于 北京
