AI代理公司为何在生产中失败(以及实际建造什么)

2026年9月5日1 次浏览来源:Dev.to阅读原文

最初发表于tamiz.pro.

制作现实检查每个AI代理演示都显得神奇,直到它击中了制作.

当你试图运送一个, 现实设定在: 幻觉,背景漂移, 无法预测的失败, 和零再生。

工程师们花了几周的时间 消防箱 从未出现在笔记本中 核心问题不是LLM——这是代理架构.

代理将非决定性的决定连在一起,每个步骤以指数方式乘以失败模式.

一个对一个目标产生误解的策划者,一个返回稍有错误的数据的工具,一个忘记了关键上下文的内存系统——其中任何一个都可以使整个工作流程出轨.

为何特工在实际制约下崩溃 没有决定性的后退路径。

当LLM自信地返回垃圾时,没有断路器.

代理继续前进, 复合错误。

无所限制的状态空间.

每一个提示都是一卷新鲜的骰子。

与传统软件不同,你不能重放输入并期望同样的结果.

调试是不可能的 。

不能以快取为分分.

追踪特工为何有所作为 需要重建概率推理链 工具集成很简陋。

特工们假设工具行为完美,但真正的API会超时,返回部分数据,或者不加警告地改变计划.

生产方面有什么作用 停止建筑代理。

开始构建由LLMs所增强的确定性系统,LLM只处理模糊层.

1.

故意分类,而不是规划,用一套固定的意向代替免费制剂规划。

使用 LLM 将用户请求分类到预定义的桶中,然后向确定处理器路径.

这使得您有可预测的路由,可测试的处理器,以及清晰的故障模式.

2.

结构化工具执行 别让特工随意调用工具 预定义工作流程为定向循环图(DAG),并仅使用LLMS来提取参数.

每个步骤都是决定性的。

LLM的工作只是填补参数,而不是组织执行.

3.

LLMs前护卫系统验证投入,执行业务规则,并在任何产品到达模型之前对产出进行消毒。

将LLM调用像外部API响应一样——永远不要盲目地相信它们. "懒惰剂替代剂"大多数剂使用案例倒塌为三种模式之一: 分类+路由图——用户输入到已知动作的地图 提取+验证——从无结构的文本生成+调取结构化数据 填入由LLM出品的内容模板 构建这三种原始.

编作.

运送他们。

你会有一个95%的工时 能够修复剩下的5%的系统 停止构建机器人, 开始构建工具 最成功的AI动力产品将LLMs视为专门的同处理器,而不是自主的代理.

GitHub Copilot不计划你的代码库——它完成行.

ChatGPT不能管理您的日历——它回答了问题.

未来不是自主代理.

这是LLM加速器的定型系统 在人类模糊度重要的点上闪起 常被问到的问题 问:这难道不让我的产品更"聪明"吗?

A:定义"聪明".

如果智能意味着可靠地解决用户问题,是的——决定性的系统比不可预测的失败的代理更聪明.

问:我如何处理固定工作流程没有覆盖的边缘案件?

答:记录下来。

用交接方式向用户展示 基于实际使用,而不是假设未来需要,构建出新的意图/工作流程.

问:多步推理任务如何?

答:将其打入单步取出.

链定函数.

让LLM一次做一件事 而不是一次做一切.

分享