返回技术博客
Simon 和 Karpathy 都在提醒:AI 编程最缺的不是 prompt,是验收能力

Simon 和 Karpathy 都在提醒:AI 编程最缺的不是 prompt,是验收能力

Simon 和 Karpathy 都在提醒:AI 编程最缺的不是 prompt,是验收能力

Simon Willison 在 2026 年 8 月 22 日写了一句很适合作为 AI 编程时代的标语:高效使用 coding agent 的关键技能,是能清楚指示它怎么改,并且有信心验证这些改动是否正确。

这句话看起来朴素,但非常重要。过去大家谈 AI 编程,常常把注意力放在 prompt:怎么写提示词、怎么让模型一次生成更多代码、怎么让 agent 自动跑更久。Simon 的判断反过来提醒我们,真正拉开差距的不是“让 AI 写”,而是“你能不能验收 AI 写出来的东西”。

他还补了一句:验证不总是逐行读完模型写的每一行代码。逐行看当然有价值,但从来都不是验证软件变更的唯一方式。真实工程里,我们还会跑测试、看 diff、检查接口契约、复现用户路径、做类型检查、看日志、设计回归用例、确认数据库迁移、验证边界条件。

这和 Karpathy 过去几个月对 coding agent 的看法可以放在一起读。Karpathy 一方面很早就说自己越来越多用英文编程,另一方面也一直提醒当前 agent 容易过度假设、过度构建、交付大量看似能跑的代码。他更喜欢小步协作,希望模型在不确定时提问,引用 API 文档,展示自己如何确认用法正确,而不是离开很久后带回一堆代码。

这两个人的共同点是:他们都不把 AI 编程理解成“人类退出”。相反,人类的角色变得更像任务设计者、上下文提供者、验收者和质量负责人。AI 可以承担大量 grunt work,但人要决定任务边界、成功标准和风险边界。

这对开发者很现实。用 coding agent 写代码,最容易翻车的场景不是模型完全不会,而是它“差不多会”。它能生成一个结构完整的实现,能编造合理解释,甚至能跑过一部分测试。但它可能改错业务语义、绕开既有约束、偷偷引入不必要抽象,或者在某个边界场景留下坑。

所以 AI 编程的工作流要从“给 prompt”升级成“给验收口径”。一个更可靠的任务应该包含几件事:目标是什么,不要碰什么文件,已有模式在哪里,成功后应该通过哪些测试,用户路径怎么验证,哪些情况需要停下来问人。prompt 只是入口,验收条件才是护栏。

这也解释了为什么 Agent 工具最近都在往工程化走。Codex、Claude Code、Grok Build、Cursor、Aider、Cline,都不只是拼模型能力,也在拼 diff、权限、测试、上下文、回滚、计划和审计。因为当模型越来越会写代码,短板就自然转向“怎么证明它没写错”。

对团队来说,最重要的改变可能不是买哪个工具,而是重写开发习惯。需求要更小块,任务要更可测,代码库要有更好的测试和 lint,架构约束要写进文档,危险操作要有审批,AI 生成的变更要能被快速验证。没有这些,agent 越强,越可能把错误放大得更快。

我更倾向于把 AI 编程看成“验收驱动开发”的一次回归。过去我们写代码前要想清楚测试,今天我们让 agent 写代码前也要想清楚怎么判断它对了。模型会让实现成本下降,但不会自动让判断成本消失。

这篇适合发给开发者读者,因为它能把“AI 会不会替代程序员”的空泛争论拉回到每天要做的事:拆小任务、写清楚约束、跑测试、看差异、验证用户路径、让 AI 解释关键选择。

我的判断是,2026 年真正会用 AI 编程的人,不是最会写花哨 prompt 的人,而是最会设计可验证任务的人。prompt 是发动机,验收才是方向盘。

参考来源:Simon Willison:Archive for Saturday, 22nd August 2026Business Insider:Andrej Karpathy on AI agents and collaboration