Agent 实验室 · EXP 004

多 Agent 不是多开几个窗口:Anthropic 为并行研究付过的学费

· 外部实践案例:并行研究的分工、预算与停止条件

多 Agent 最容易演示的部分,是同时开出几个子任务。最难的部分,是证明这些子任务没有在重复劳动,而且额外花掉的 token 和复核时间值得。

不体面的早期表现

Anthropic 在 Claude Research 的生产复盘里,公开过一组并不体面的早期表现:系统会为简单问题生成 50 个子 Agent;有的 Agent 不停寻找根本不存在的来源;有的不断发送更新,干扰其他 Agent;还有几个 Agent 接到含糊任务后,重复搜索同一件事。[E1]

这不是「模型还不够聪明」可以概括的问题。并行把搜索能力放大的同时,也把模糊分工、错误方向和资源浪费一起放大了。

Claude Research 最终采用了一个主研究 Agent、多个搜索子 Agent 和一个引用 Agent。主 Agent 先保存计划,把问题拆成可以独立探索的方向;子 Agent 在各自上下文里搜索并压缩结果;主 Agent 判断证据是否已经足够;最后再让 Citation Agent 定位引用。[E1]

最关键的改动:教主 Agent 怎样下任务

其中最关键的改动不是「允许创建更多 Agent」,而是教主 Agent 怎样下任务。

Anthropic 最初给出的指令可能只有「研究半导体短缺」。结果,一个子 Agent 跑去研究 2021 年汽车芯片危机,另外两个同时搜索 2025 年供应链。[E1] 后来,每个任务都需要写清目标、返回格式、工具和来源、工作边界。分工不再按「大家都去查一下」展开,而要让每个人带回不同的证据。

他们还直接把资源尺度写进提示词:简单事实查询用一个 Agent 和 3—10 次工具调用;直接比较用 2—4 个子 Agent、每个 10—15 次;真正复杂的研究才可能使用十个以上子 Agent。[E1] 这些数字不是行业标准,却说明一件事:Agent 不擅长自己判断「这个问题值得花多大力气」,预算需要被明确教进去。

15 倍 token 与 90.2%:怎么读这些数字

为什么要这么克制?因为 Anthropic 自己的数据里,普通 Agent 相对聊天大约使用 4 倍 token,多 Agent 系统大约使用 15 倍。[E1] 这个 15 倍不是固定的美元账单,却足以说明,多 Agent 的默认结果不是省钱,而是用更多计算换取更广的搜索。

Anthropic 的内部评测显示,Opus 4 主 Agent 加 Sonnet 4 子 Agent,在其 research eval 上比单一 Opus 4 高 90.2%。这同样只能按厂商内部评测理解:题集、绝对分数和外部复现没有完整公开。更值得相信的边界,反而是他们主动写出的「不适用」场景——当任务需要所有 Agent 共享大量上下文,或者步骤彼此依赖时,多 Agent 并不好用;多数编码任务就常常缺少真正可并行的分支。[E1]

被忽略的成本:它最后变成了一个分布式系统

实际运行中还有另一种成本。主 Agent 同步等待子 Agent 时,会被最慢的一项卡住,也无法在搜索过程中及时纠偏。改成异步又会带来状态一致性和错误传播。长任务一旦失败,从头重跑很贵,所以 Anthropic 增加了计划保存、checkpoint、重试、恢复和生产 tracing。[E1] 并行研究最后变成了一个需要长期维护的分布式系统,而不是几条提示词。

可试小方法:第一次只开两个子 Agent,各写一张「分工卡」

对小团队来说,可以先做一个更小的实验:第一次只开两个子 Agent,并在启动前各写一张「分工卡」。

适用前提:问题至少存在两个可以独立调查、最后再合并的方向;单人顺序搜索已经可能遗漏重要分支,且研究结果的价值足以覆盖额外模型和复核成本;有一个主负责人负责去重、冲突判断和最终事实责任。

最小动作——卡上只放五件事:

  1. 它只回答哪个具体问题;
  2. 明确不处理什么相邻问题;
  3. 优先使用哪些来源和工具;
  4. 返回格式:结论、证据链接、未知、冲突;
  5. 预算:最多工具调用数或时间,以及停止条件。

主负责人在启动前检查两张卡会不会搜索同一对象;回来后只统计「独有且可用的一手证据」,再决定是否需要第三个 Agent。

观察信号:两个 Agent 返回链接或事实的重复比例;每个 Agent 带回的独有一手证据数量;主负责人为去重和解决冲突花的时间;token/工具调用相对单 Agent 基线的增量;新增 Agent 是否真的改变结论。

停止或收束条件:两个 Agent 大部分结果相同,或第二轮没有新增关键一手证据,就停止扩员,由主负责人收束;剩余问题彼此强依赖、必须共享同一大段上下文,改回一个 Agent 顺序处理;来源冲突涉及高风险判断,让人或独立审读者回查原文,不要用多数 Agent 投票;协调和复核时间已经超过顺序研究的预估收益,就结束并行——不为了「已经启动多 Agent」继续消耗。

Anthropic 的案例说明,多 Agent 的价值来自「独立方向可以并行」,代价则来自「所有含糊之处也会并行」。真正的工程能力不是一次叫来多少 Agent,而是知道什么时候不该再叫下一个。


附:本文证据使用说明

本文属于 Agent 实验室的外部真实实践案例线:写的是具名团队(Anthropic)在生产环境里实际怎样运行多 Agent 研究系统。90.2%、15 倍 token、「最高缩短 90% 研究时间」均为 Anthropic 内部评测或自报统计,无外部复现,本文只把它们当作「该系统确实进入生产」的证据,不当作用户可预期的收益。「分工卡」是本文从其公开复盘提炼的编辑方法,不是 Anthropic 原文提供的模板。全部事实来自公开官方页面 [E1]-[E3],访问时间 2026-09-30。外部事实归原出处,提炼与错误归本文。