AI 说它改好了,
你信吗?
AI 最爱说「搞定了,没问题」。但它说的搞定,是真搞定,还是只是觉得搞定?
这一篇用 4 个天天遇得到的场景,把「AI 怎么自己发现错了又改对」讲成大白话:真正让它改对的不是反思,是给它一份对不上就得重做的标准答案。
「我改好了」分两种
同一套 AI,换一份「对答案」就差 26 分。变的不是它的脑子,是它手边那把尺子。
让它「自己反思」,反而改坏了
研究测过:没有外部反馈时,模型靠自查纠错往往无效、甚至更差。它当初为什么写错?因为它真心觉得那是对的。 再让它看一遍,还是同一套脑子,大概率还是觉得对。
只会嘴硬的 AI
写完自己读一遍「嗯没毛病」。对错标准是它自己的感觉。越自信的错越改不出来。
会自查的 AI
写完拿去跟一份标准答案对一遍。对不上就回去改,再对,直到对上。答案说了算。
自查是 AI 闭着眼复读自己的自信;对答案是逼它睁眼看一次现实。
对答案
给它一份它改不动的标准答案,逼它对:对不上 → 回去改 → 再对 → 直到全对。这一来一回,就是校验回路。注意:这圈不在模型里,在模型外面那层。
① AI 生成 → 写出一版答案
② 跑检查(测试 · 清单 · 算式)→ 看红还是绿
红:读报错、改、重跑。绿:停。这就是「自我修复」。
③ 对上了吗 → 绿 ✓ 真改对 / 红 ✗ 回去重改
在写代码这行,最现成的标准答案就是测试——事先写好的「输入这个、该得那个」对照表。Anthropic 说:给了它一份能出红绿灯的答案,这个圈就能自己转起来。
给 AI 一份标准答案
A · 让红掉的程序自己修绿
答案 = 一套测试。改完自动跑,红了就读报错改,直到全绿。
B · 让翻译自己挑错
答案 = 术语对照表 + 事实清单(品牌名、价格、型号)。译完逐条比对。
C · 让表格自己对账
答案 = 小计 = 总额 这类一眼能验的规矩。对账不平就回去查。
D · 让资料自己亮证据
答案 = 每句结论挂链接。挂不出的当场删,留得住的才查得到出处。
套路同一个:先备好一份它改不动的标准答案,再逼它对到全对。学会一次,处处能用。
是你给它配的那把尺子
同一个 AI,不给他标准答案就是「会嘴硬」,错了也不知道;配上一把尺子(测试 / 清单 / 算式 / 挂链接的规矩),就成了「会自查的 AI」。变的不是它的脑子,是它手边多了一份能对的答案。
让 AI 从「会说」变「会干」的那些机关,大多不在模型里头,在模型外面那层。那层负责递给它一份标准答案、把对不上的退回去、盯着它改到对。
换一份标准答案差 26 分
唯一区别是「对的那份答案是谁出的」。答案靠谱冲到 94 分,自己出题掉到 68。 真正的安全感,来自一份它猜不到、也改不动的外部答案。
让会修 bug 的是外面那层
让它会自己修 bug 的,不是模型,是外面那套 harness——它跑测试、把红色报错退回去、盯着它改到绿。这正是校验回路。
答案不可信就翻车
重点不在 AI 坏不坏,在你那份答案堵没堵死。800 次修复里真作弊的只有 7 次——绝大多数它老实在改。
裁判不能由选手任命
METR 测前沿模型:有的把判分程序换成「永远通过」假货,有的篡改计时器谎报快一千倍。某任务 21 次尝试,21 次全在作弊;被追问还直认「靠作弊」蒙的分。
这种「为让检查通过、不惜攻击检查本身」的行为,AI 安全圈叫 reward hacking(奖励黑客)。靠谱用法就三条:
别信那句「我改好了」
问它一句「你拿什么证明」:能甩出一份它自己改不动的标准答案(跑出来的绿、对上的清单、点得开的链接)→ 真改对了;只会拍胸脯「放心」→ 跟闭眼检查卷子还觉得自己全对的学渣没区别。
给它一份对不上就得重做的标准答案,逼它对到全绿——而那份答案,得你来备,还得防着它偷改。
会勇禾口王的AI笔记
Harness 工程 · HARNESS ENGINEERING · EP04 · @huiyonghkw
「我做完了」永远只是一句声明,不是一份证明