Claude Code 动态工作流:让 Agent 学会自己编排测试脚手架 · 干货攻略

  • 链接:https://x.com/omarsar0/status/2080323178119786642
  • 分类:x-tips
  • 来源:X @omarsar0
  • 作者:Jay
  • 更新:2026-07-26

这是什么

Claude Code 动态工作流(Dynamic Workflows)是 Anthropic 于 2026 年 5 月 28 日(随 Opus 4.8 发布)推出的研究预览功能,核心解决一个长期难题:LLM Agent 的编排逻辑(即"谁在什么时机调用谁")本质上是硬编码的,无法动态适应任务规模

动态工作流的解法是:让 Claude 自己写一个 JavaScript 编排脚本,然后由运行时执行该脚本,同时拉起数十到数百个并行的子 Agent。脚本中定义阶段(phase)、分支逻辑、中间结果变量;Claude 的主会话全程保持响应。

用 @omarsar0 的话说,这是"元脚手架(meta-harness)"思路——不是用预定义的 harness/automations/loops/routing/graphs,而是让 Agent 动态生成适合当前任务的脚手架本身

核心数字(来自官方文档)

参数 数值
发布时间 2026-05-28(研究预览)
最低版本 Claude Code v2.1.154
付费计划 Pro / Max / Team / Enterprise
并行 Agent 上限 同一阶段最多 16 个并行;单次运行硬上限约 1,000 个
支持提供商 Anthropic API / Amazon Bedrock / Google Cloud Vertex AI / Microsoft Foundry

为什么值得关注

背景:预定义 Agent 编排的天花板

传统的 multi-agent 系统(subagents、agent teams、skills)都是人在设计编排策略:人在 prompt 里写清楚"先做什么、再做什么、谁负责什么"。这在任务固定、规模已知时可行,但面对以下场景就力不从心:

  • 超大规模代码迁移(数千文件、人力估算需数月)
  • 需要交叉验证的长程研究(多源信息相互核实)
  • 自适应路由(不同子任务的最优模型不同,需要动态分配)

谁分享的(@omarsar0)

@omarsar0 是长期追踪 LLM & Agent 研究的独立博主,也是本知识库 X 雷达硬核干货来源之一。他指出:

"Dynamic workflows are a generalization of harnesses, automations, loops, routing, and graphs. It's the most powerful feature I have built into my agent orchestrator."

他受 Claude Code 动态工作流启发,在自己的 agent orchestrator 中独立实现了类似能力,并成功泛化到 claude / codex / pi / hermes 等多种后端。

解决什么问题

  • 无需预先知道任务规模:Claude 自动把任务拆解为合适的阶段和子任务
  • 脚本化可复用:编排逻辑变成 JavaScript 文件,可以 save 下来、重复运行、他人 review
  • Token 账本透明:每个阶段显示 agent 数量、token 消耗、耗时,便于成本控制
  • 可中断可恢复:运行中途可暂停/终止,已完成阶段无需重跑

核验过程

官方来源

1. code.claude.com/docs/en/workflows(官方文档)

  • 确认上线日期:2026-05-28,随 Opus 4.8 一同发布(研究预览)
  • 确认版本要求:v2.1.154+
  • 确认并行上限:同一阶段最多 16 个并行 Agent;单次运行上限约 1,000 个(硬上限防止资源失控)
  • 确认适用计划:Pro / Max / Team / Enterprise;Pro 需在 /config 中开启 Dynamic Workflows 行
  • 确认 Bundle 工作流:/deep-research 为内置工作流(fans out 多角度网络搜索 → 交叉核实 → 投票 → 汇总带引用的报告)
  • 确认 Phase 机制:每个 phase 含 agent 计数、token 总量、已用时间;可 drill down 查看每个 agent 的 prompt、tool calls、结果

2. 官方博客(Anthropic, 2026-05-28)

  • 确认"让 Claude 自己写编排脚本"的核心设计思路
  • 确认适合场景:codebase-wide bug sweep、500-file migration、跨源交叉核实研究、hard plan 多角度起草

3. LinkedIn(Fabrice Bernhard, 2026-07)

  • 确认 Bun 项目(Jarred Sumner)从 Zig 迁移到 Rust的规模:1,009,257 行代码,11 天完成,测试覆盖率 99.8%
  • 注:不同来源对天数的描述有出入(6 days vs 11 days),LinkedIn 原始帖给的是"5月3日开始,5月14日合并",共11天。此数字来自第三方转述,原帖主张,未逐一核验。

交叉验证

说法 验证结论
上线日期 2026-05-28 ✅ 多源一致(LinkedIn、medium、latent.space 等)
v2.1.154+ 要求 ✅ 官方文档明确
Bun 1M 行 11 天迁移 ⚠️ 原帖主张(Jarred Sumner 原始博客未直接找到);多源转述一致(Fabrice Bernhard LinkedIn、techscoop.substack、simonwillison.net),但具体数字建议以官方博客为准
16 并行 / 1,000 上限 ✅ 官方文档明确
/deep-research 内置 ✅ 官方文档明确

上手步骤

开启动态工作流(Pro 计划)

在 Claude Code 中运行:
/config

找到 "Dynamic workflows" 行,启用。

方式一:直接使用内置 /deep-research

适合快速验证,不需要写任何脚本:

/deep-research <你想研究的问题>

Claude 会自动 fan out 多个角度的 web 搜索 → 核实来源 → 投票筛选 → 汇总带引用的报告。

方式二:让 Claude 写自定义工作流

描述任务,让 Claude 自己生成 JavaScript 编排脚本:

# 示例:大规模代码迁移
将 /workspace/legacy-repo 下的所有 .py 文件迁移到新的目录结构,
每个子目录分配一个子 Agent 处理,并在结束后运行测试。

(Claude 会自动生成阶段和并行策略)

生成后,你可以: - Review 脚本:Claude 生成的 JS 文件,可以像普通代码一样 review - Save 复用:满意后 /save <command-name> 存为自定义命令,下次直接调用 - 调整参数:修改 JS 中的 agent 数量、阶段定义后重新运行

监控运行状态

/workflows
# 然后用方向键选择运行中的工作流,回车查看详情

实时显示:每个 phase 的 agent 数、token 总量、已用时间。按 p 暂停/恢复,x 终止。

适用场景 vs 不适用场景

适合 不适合
规模大到单个会话无法处理的任务 写一个函数、改一处 bug(用普通会话更快)
需要多个独立视角交叉验证的任务 任务边界不清晰、无法描述目标的场景
长期运行的代码迁移、审计、评测 紧急 hotfix(启动开销太高)
编排策略本身值得被固化复用的任务 token 预算敏感的场景(大规模并行成本高)

坑与适用边界

Token 成本是最大坑

多个来源明确警告:动态工作流的 token 消耗远高于普通单会话。官方文档建议在大规模任务前估算成本。Anthropic 官方博客的原始数据未找到,建议以官方博客更新为准,不引用坊间流传的具体美元数字。

1,000 上限是硬上限

Claude Code 在单次运行中设置了约 1,000 个 agent 的硬上限,防止失控。16 并行上限也存在,但官方文档指出在 v2.1.196+ 中有调整空间,具体以官方文档为准。

失败粒度管理

如果某个 phase 的某个 agent 失败,工作流可以继续(取决于你的脚本逻辑),但建议在脚本中加入错误处理和重试机制。

版本要求

v2.1.154 以下不支持。如果你的 Claude Code 没有收到更新通知,检查版本号:/version--version

适用地区/平台限制

  • Anthropic API 直接支持
  • Amazon Bedrock(部分地区)
  • Google Cloud Vertex AI(部分地区)
  • Microsoft Foundry(部分地区)
  • 中国大陆直连 Anthropic API 需自行解决网络问题

与 Agent Teams 的区别

官方文档给出了明确区分:

Subagents Skills Agent Teams Dynamic Workflows
谁持有编排计划 Claude(逐轮决定) Claude(按 prompt) Lead agent(逐轮决定) 脚本本身
规模 每轮少数任务 同 subagents 数个长期运行的 peer 数十到数百个/次
中间结果存在哪 Claude context Claude context 共享任务列表 脚本变量
可复用性 worker 定义 instructions team 定义 脚本本身

一句话结论

Claude Code 动态工作流把"编排逻辑"本身变成了一段 Claude 写的 JavaScript——你描述任务,它生成脚手架,可保存复用也可临时跑;Bun 用它 11 天迁移了 100 万行代码,证明了超大规模代码操作的可行性——适合长程复杂任务,但 Token 成本和使用门槛都不低,值得先用 /deep-research 小跑一下感受量级。