一个人怎么指挥
一支 AI 小队
让一个 AI「自己转起来」之后,harness 里还有块机关能让「一个变一群」:子代理、fan-out。
有意思的是——两个最懂行的团队,对它给出完全相反的结论。这一期把硬币两面摊开,给你一把尺子。
同一机关,两种相反结论
两个顶尖团队都对。他们盯着同一块机关,只是手里拿的是两种不同的活。下面就把它拆开看清楚。
主管派活给一组实习生
subagent(子代理)= 临时工:主代理临时雇来干一块活的小 AI,干完就散。fan-out → fan-in:把活撒出去并行干,再把结果收回来汇总。
你是主管,手上一大活「摸清一个行业」。要么自己从头查到尾(一条线),要么叫来四个实习生各查一块(政策 / 公司 / 技术 / 口碑),同时开干,最后你汇编成一份。后者就是 fan-out + fan-in。
正式名字叫 orchestrator-worker(指挥-工人),也就是 map-reduce。每个子代理跑在自己的上下文窗口里、互不通气,干完只把一段摘要交回——「实习生交报告,不交草稿」。
派一支小队,成绩高 90.2%
内部研究评测上,小队(Opus 4 领队 + Sonnet 4 子代理)比单打独斗的 Opus 4,成绩高出 90.2%;并行把复杂任务研究耗时最多砍掉 90%。
代价藏在背面:并行省的是你等的时间,不是总工作量。token 反而更高(约 15×)。所以下面那派要揪着不放的,正是这条小尾巴。
别搭多代理,你会得到脆弱系统
他们把力挺派当卖点的「独立上下文」,当成病根:四个子代理各开脑子、互不通气,基于互相打架的假设各干各的,最后半成品根本拼不到一起。
🧱 两条铁律
① 共享上下文,而且要共享完整行动轨迹,不只是几条消息。
② 每个行动都隐含一个决策,互相打架的决策带来糟糕结果。
例子:两个子代理并行做 Flappy Bird,一个画卡通、一个画像素——风格对不上,拼装的 agent 补不圆,活废了。越要大家对齐的活,互不通气越要命。
而且贵是结构性的:约 15× token,Anthropic 自己说「光 token 用量就解释了 80% 的成绩差异」——它赢,很大程度是因为舍得烧。
决定你看哪面的是活的 type
正面 = 优势
变相扩容、广度优先、墙钟时间砍九成 → 研究类活吃这套。
背面 = 软肋
互不通气、半成品拼不起来 → 写代码类活栽这套。
分水岭就一句:这块活,能不能拆成几条互不依赖的平行线? 能拆、读多写少 → fan-out 赢;要共享状态、写多依赖重 → 单线程更稳。
fan-out 的甜区长这样
「摸清 fan-out」正好是个标准 fan-out:要同时去 Anthropic 博客、Cognition 博客、Claude Code 文档好几条独立线索挖料——读多写少、能拆、互不依赖。
人来把关:每句大佬原话我人肉二次核实;拿不准的标成转述,不硬充引用。敏感判断不交给概率系统。
主代理并行起了 4 个子代理
一句话派下去,主代理直接并行起 4 个子代理,各认领一套配色同时做——上半屏「Running 4 agents」,主轴「Galloping 8m15s」是主代理在盯着,不是自己上手。
为什么敢放手?四套配色是四条互不依赖的平行线,谁也不用跟谁对齐——正是「能拆、读多写少」的甜区。同一支小队,会不会翻车只看我派的活拆不拆得开。
先问能不能拆
Q1 · 子代理越多越聪明?
不是。多出来的是「并行的人手」,不是智商。拆不开还硬派,就是「为简单问题派 50 个子代理」那种翻车。先问能不能拆,再问要不要多。
Q2 · fan-out 是省钱省时神器?
它省的是你等的时间,不是钱——恰恰更烧钱(约 15× token)。本质是拿钱换时间。日常小问题用它,纯属杀鸡用牛刀还倒贴牛。
Q3 · 到底该听谁的?
两边都别全听,听你手里那块活的。能拆、读多写少 → 派小队;要共享状态、写多依赖重 → 单线程。
会勇禾口王的AI笔记
Harness 工程 · HARNESS ENGINEERING · EP03 · @huiyonghkw
别再问「该不该上多代理」,问「这块活拆得开吗」