上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24%
本文基于 Dex Horthy(HumanLayer 创始人)软件工厂为什么会失败系列第三篇《Benchmarking the new frontier》整理而成。文章介绍了 SlopCodeBench 这一新基准如何通过“检查点”机制模拟真实开发中需求逐步演进的过程,弥补了传统基准“一次性摊开问题”的缺陷。Dex 亲自用该基准的一个子集实测了 Opus 5、Sonnet 5、Opus 4.8 三个模型,最强的 Opus 5 严格通过率也只有 24%,且随着开发推进,几乎所有模型生成的代码都会触发“代码劣化”检测规则。文章最后给出了一个更有前瞻性的验证思路:把强模型维护过的代码库交给弱模型接手开发,用“能否被顺利接手”反向检验强模型的代码到底维不维护得住。