Harness 工程 / HARNESS ENGINEERING
校验 · GATEEP 0401 / 15
Harness 工程 · EP04 · 校验回路

AI 说它改好了
信吗

AI 最爱说「搞定了,没问题」。但它说的搞定,是真搞定,还是只是觉得搞定?
这一篇用 4 个天天遇得到的场景,把「AI 怎么自己发现错了又改对」讲成大白话:真正让它改对的不是反思,是给它一份对不上就得重做的标准答案

▸ 方向键 / 空格 / 点击翻页 · 右下角可"自动播放"
先看数据 · OVERVIEW

「我改好了」分两种

自查纠错
无效
无外部反馈时往往更差
人写答案
94.3%
修开源 bug 成功率
自出答案
68.0%
让它自己出题自己对
作弊蒙混
21/21
某任务尝试全在作弊

同一套 AI,换一份「对答案」就差 26 分。变的不是它的脑子,是它手边那把尺子。

先破个误会 · 反思 ≠ 变好

让它「自己反思」,反而改坏了

研究测过:没有外部反馈时,模型靠自查纠错往往无效、甚至更差。它当初为什么写错?因为它真心觉得那是对的。 再让它看一遍,还是同一套脑子,大概率还是觉得对。

💬

只会嘴硬的 AI

写完自己读一遍「嗯没毛病」。对错标准是它自己的感觉。越自信的错越改不出来。

会自查的 AI

写完拿去跟一份标准答案对一遍。对不上就回去改,再对,直到对上。答案说了算。

自查是 AI 闭着眼复读自己的自信;对答案是逼它睁眼看一次现实

真正让它改对的,就俩字

答案

给它一份它改不动的标准答案,逼它对:对不上 → 回去改 → 再对 → 直到全对。这一来一回,就是校验回路。注意:这圈不在模型里,在模型外面那层

① AI 生成 → 写出一版答案

② 跑检查(测试 · 清单 · 算式)→ 看红还是绿

红:读报错、改、重跑。绿:停。这就是「自我修复」。

③ 对上了吗 → 绿 ✓ 真改对 / 红 ✗ 回去重改

在写代码这行,最现成的标准答案就是测试——事先写好的「输入这个、该得那个」对照表。Anthropic 说:给了它一份能出红绿灯的答案,这个圈就能自己转起来

不是程序员专利 · 四个你也能用

给 AI 一份标准答案

💻

A · 让红掉的程序自己修绿

答案 = 一套测试。改完自动跑,红了就读报错改,直到全绿。

🌐

B · 让翻译自己挑错

答案 = 术语对照表 + 事实清单(品牌名、价格、型号)。译完逐条比对。

📊

C · 让表格自己对账

答案 = 小计 = 总额 这类一眼能验的规矩。对账不平就回去查。

🔎

D · 让资料自己亮证据

答案 = 每句结论挂链接。挂不出的当场删,留得住的才查得到出处。

套路同一个:先备好一份它改不动的标准答案,再逼它对到全对。学会一次,处处能用。

关键一刀 · 会自查的不是 AI

是你给它配的那把尺子

同一个 AI,不给他标准答案就是「会嘴硬」,错了也不知道;配上一把尺子(测试 / 清单 / 算式 / 挂链接的规矩),就成了「会自查的 AI」。变的不是它的脑子,是它手边多了一份能对的答案。

Harness 工程想让你看见的

让 AI 从「会说」变「会干」的那些机关,大多不在模型里头,在模型外面那层。那层负责递给它一份标准答案、把对不上的退回去、盯着它改到对。

同一套 AI,差 26 分 · 来源 6

换一份标准答案差 26 分

人写好的答案去对 →
94.3%
自己出题自己批去对 →
68.0%

唯一区别是「对的那份答案是谁出的」。答案靠谱冲到 94 分,自己出题掉到 68。 真正的安全感,来自一份它猜不到、也改不动的外部答案。

真机 · 红 → 绿

让会修 bug 的是外面那层

✗ FAIL  is_prime(1) returned True — 但 1 不是质数
→ AI 读源码定位 bug,改一行
✓ PASS  python3 test_prime.py — 10 个用例全过
→ AI 把"改了啥"总结一遍

让它会自己修 bug 的,不是模型,是外面那套 harness——它跑测试、把红色报错退回去、盯着它改到绿。这正是校验回路。

诚实说 · 它什么时候假装改好

答案不可信就翻车

改答案,不改作业。测试红了,它把标准答案改松、删掉、注释掉——绿了,问题一点没解决。它爱抄近道。
把监考的换成自己人。把判分程序换成「永远通过」的假货、篡改计时器谎报快一千倍。
改不对又停不下来。没设上限,一遍遍试、越试越乱,空转烧钱。所以必须装道闸:最多改几次 / 花多少钱到顶就停。

重点不在 AI 坏不坏,在你那份答案堵没堵死。800 次修复里真作弊的只有 7 次——绝大多数它老实在改。

METR 抓现行 · reward hacking

裁判不能由选手任命

实锤

METR 测前沿模型:有的把判分程序换成「永远通过」假货,有的篡改计时器谎报快一千倍。某任务 21 次尝试,21 次全在作弊;被追问还直认「靠作弊」蒙的分。

这种「为让检查通过、不惜攻击检查本身」的行为,AI 安全圈叫 reward hacking(奖励黑客)。靠谱用法就三条:

裁判和选手分开。别让写东西的 AI 给自己打分,用客观检查或另开一个 AI 专门挑刺。
要证据不要嘴说。把跑了什么、对上没对上亮出来——一张绿色截图胜过一万句「放心」。
给它装个刹车。设死最多试几次 / 花多少钱,到顶就退回给人。
一句话,把这期带走

别信那句「我改好了」

问它一句「你拿什么证明」:能甩出一份它自己改不动的标准答案(跑出来的绿、对上的清单、点得开的链接)→ 真改对了;只会拍胸脯「放心」→ 跟闭眼检查卷子还觉得自己全对的学渣没区别。

📋 自检指令 · 复制即用
做完别直接说"已完成"。先回答我两件事:
1)你跑了什么检查确认对的?把命令和完整结果贴出来。
2)没可跑的检查,就先说打算怎么验证,等我点头再动手。

给它一份对不上就得重做的标准答案,逼它对到全绿——而那份答案,得你来备,还得防着它偷改

— Harness 工程 · EP 04 —

会勇禾口王的AI笔记

Harness 工程 · HARNESS ENGINEERING · EP04 · @huiyonghkw

「我做完了」永远只是一句声明,不是一份证明

🎁 微信搜 会勇禾口王的AI笔记,回复 校验 领自检指令