规划过度执行:157名特工逃逸和奥尔卡-斯泰尔特工舰队崛起的经验教训

2026年8月24日1 次浏览来源:Dev.to阅读原文

最初发表于tamiz.pro.

AI代理的领域已经从单型执行器迅速转向复杂的多代理管弦乐.

但是,在跨不同任务领域运行了157个代理部署后,出现了一种具有显著一致性的模式:规划质量预测成功远胜于执行速度或模型大小.

这不仅仅是理论上的——这是一个实用的教训,它重塑了工程师建筑师代理车队的方式, 产生了我们现在所谓的Orca风格的代理: 等级式,规划式的第一系统, 将昂贵的思维业务与廉价的工作分开。

实验:157名特工逃跑 6个多月来,我们小组部署和监测了157个不同的代理人,涉及4个主要使用情况:代码生成管道、自动化测试工作流程、基础设施即用代码提供以及数据转换任务。

每跑由三个维度不同: 架构:单方代理对平方多代理对分级(Orca-style) 规划深度:没有规划,简短的意向声明,或完全的递归性规划循环 执行模式:每个动作直接LLM呼叫与被验证的工具强化执行 结果毫不含糊。

在规划中投入3至5x多代币的系统实现了4.2x高任务完成率和3.8x更低的回滚周期,而纯为快速执行而优化的代理商.

每一个领域的规划先进程度与成功之间的关联。

为何计划胜过原始处决 这一结论背后的直觉基于LLM使用的经济原则:相对于代价高昂的错误,规划是廉价的.

结构完善的计划会降低执行错误的工具序列,进行错误的API呼叫,或生成失败集成测试的代码的概率.

考虑象征性的经济学: 阶段托肯(典型) 成本影响计划(意图+分解) 800–2,500 低执行 每一个子任务 300–1,200 中修正 失败后 1,500–4,000 高代理 彻底规划其成本。

那些急于执行的人往往在矫正、重复和人类干预方面付出了成倍多的代价。

奥尔卡建筑模式 "Orca"这个名字来源于虎鲸的分级社会结构:一个单一的母性管弦乐团,而专业的播客成员执行离散的任务.

从代理角度来说,这相当于: 核心组成部分战略规划员(母权): 持有全球背景,分解目标,指定子任务,验证结果.

运行在更强的模型上,上下文窗口更长.

专家执行员(the socke):每个操作一个狭义域-代码生成,测试写作,文档,验证.

运行在规模较小,成本更低的模型上,以优化吞吐量.

共享内存层:一个结构化的知识图或矢量存储,能维持整个机队的状态,防止冗余工作并促成交叉代理学习.

Orchestration Loop:一个轻量级控制器,它可以引导任务,汇总结果,并在验证失败时触发再规划.

为什么这个分离问题 关键的观点是,并非所有思维都是平等的。

战略决定——谅解要求、确定边缘案例、顺序依赖性——从深层背景和推理中受益。

策略性决定——格式化产出,调用特定的API,生成模板——由重点突出,优化的模型更好地处理.

执行模式: 模式1: 与验证盖茨互换解析 计划者将一入球分解为子任务,每个任务都有明确的成功标准.

执行者完成子任务并返回

分享