你以为在挑模型,
其实你一直在挑 harness
2026 年,模型分数一个比一个高,排行榜都快爆表了。可你用起来,是不是还是时好时坏、不太顺手?真正决定你体验的,不是模型本身,而是模型外面那一整套系统——harness。
一个反常识的真相
每一次,杠杆都往外移一层
把话说对。杠杆 = 你这一句话的措辞:加角色、加示例、加格式、让它一步步想。≈ 给员工下一句指令
给对料。杠杆 = 模型看到的全部内容:检索、记忆、把对的资料喂进窗口。≈ 给员工一个资料袋
搭对台子。杠杆 = 模型外面那整套系统:循环、工具、子代理、校验、权限、记忆。≈ 给员工配工位+流程+质检
Prompt 调的是一句话,Context 调的是一屏,Harness 调的是整个系统。
Prompt 的天花板:只会说,不会做
你把一句话打磨到极致,让它「帮我翻译电脑里的那个文件」,它也只能回你:抱歉,我访问不了你的文件。
话说得再漂亮,它依然是个只能输出文字的函数——不会真的去查、去试、去改。这就是 Prompt 的天花板:它停在「说」,到不了「做」。
Context 的天花板:窗口会满、会乱
你把一份会议纪要直接喂进去,它就能有根有据地把待办、负责人、截止时间一条不漏地扒出来。决定答案质量的,从「你怎么问」变成了「它看到了什么」。
但窗口会满、会乱、会过期,而且最关键的是——它读完这一切,还是只会「说」,不会自己动手。于是有了第三级。
Harness = 模型外面那套干活的系统
前两级再强,模型也只是一个「会聊天的脑子」。要让它真正干活,得在它外面搭一个台子,让它能循环地调工具、自己管上下文、出错自己修、做完自己验。这个台子,就叫 harness。
🚗 一句话记住:模型是引擎,harness 是整台车。
harness 到底由什么组成
会发生什么?从「会说」变「会干」
下面是个真实 harness(Pi)在干活——驱动它的引擎换成了 DeepSeek,但让它会自己修 bug 的,不是模型,是外面这套 harness。
跑测试→报红→自己定位→改完→再验证→变绿。这一整个闭环,单纯的模型做不到——它到「报红」那步,只能跟你解释为什么错。
越往外,杠杆越大
记住这个同心圈:最里面是 Prompt(一句话),外面一层是 Context(它看到的全部),最外面是 Harness(整套系统)。越往外,你能撬动的东西越多。
Prompt engineering 没有死——它只是从「主角」变成了 harness 里的一个零件。
模型是引擎,harness 是整台车
模型是引擎,harness 是底盘、变速箱、方向盘、刹车、仪表盘。引擎马力再大,没有传动系统,那连车都不是,只是个在地上空转的发动机。
2026 年,大家都在比谁的引擎强;可真正能上路、能赢的,是整台车。你以为你在挑引擎,其实你在挑整台车。
FAQ
A · 不是。Prompt 调一句话,harness 调整套系统;Prompt 只是 harness 里的一个零件。
A · 恰恰相反。好引擎更需要好底盘才跑得出来——模型越强,越值得给它配好工具和循环。
A · 不一定要自己搭,但要会「挑」。同一模型,套不同 harness(网页版 vs Claude Code vs Pi),体验天差地别。
A · 模型 + harness = Agent。Agent 是成品,harness 是让它成为成品的那套骨架。
会勇禾口王的AI笔记
Harness 工程 · HARNESS ENGINEERING · EP01 · @huiyonghkw
你以为在挑模型,其实你一直在挑 harness