预定的 LLM 校正是您运行的最不光彩的代理工作量.
一个克龙活儿在凌晨3点醒来,读出一叠记忆,请一个模型去去去掉它,总结一下,重新排位,然后把结果写回.
没人在看 没有任何聊天窗口,没有流出的迹象,也没有人可以点击按钮.
它只需要工作,安静,每晚。 "没有人在看"的部分 正是它使得云对地的决定比看起来更困难。
当循环中有一个人类时,一个失败的API呼叫会抛出一个您可以看到并重试的错误.
在没有头部的情况下,同样的失败 变成了一个工作 挂在批准迅速 没有人会回答, 或一个包 3个月上下文 在重启时消失。
晚上的工作会打到一个主机API, 同样的逻辑也指向我的Kubernetes集群上的本地模型。
二者作业.
他们的失败不同,成本不同, 并要求不同的东西与你操作。
这是实际的取舍,不是营销版本.
当你的代理记忆不再是玩具时 你就到达这个分叉 早期,你用手或用廉价同步调用在代理循环中进行曲治.
然后记忆会增长, 修饰会变得昂贵, 你把它拉出 一个预定的工作,所以它运行 关键路径。
现在你在计时器上付了API, 有两件事开始困扰你.
首先,数据。
Curation读取了你的记忆库 来做决定 如果内存中包含的东西,你宁愿不流到第三方(内部笔记,客户背景,基础设施细节),每一个预定的船舶都会在电线上运行.
我用隐私的LLM推论来描述这个问题的一般版本, 预定的校训是它最难受的工作量, 因为它反复地,永远地触及一切。
第二,成本形状。
一个大向量商店的装饰 是一个很多的符号 对于一个工作, 不产生 用户- fasing latency 好处。
你付的保险费是每个托肯 用于一个背景任务, 它可以容忍缓慢。
本地模特儿都回答这两个问题.
他们还给你带来了全新的操作问题 这就是交易。
备选案文A:云 API 一个主机的 API 用于装饰 是最小阻力的路径。
您已经拥有客户端库, 认证流, 并且很可能是您在其它任何地方使用的确切模型 。
把工作做好,下午就结束 所出之处.
质量和零基础设施。
边疆主机模型将超越一个7B或8B本地模型,用于混乱的解析和归纳任务,你没有任何维护.
没有GPU,节点亲和,没有图像拉出.
当你的曲解逻辑复杂("只有当这两个记忆描述同一事件,否则两者都保留,并重写幸存者来吸收有用的细节时"),更大的模型真正地更好处理.
如果你的记忆力不敏感,而你的图解体积也适度,这就是正确的答案,你应该停止阅读.
所伤之处.
三处.
象征性的帐单上标出你的记忆大小,而记忆只增长.
修饰通行证本来就是读取重心的:为了决定什么是放出, 你给模型喂了一大片你储存的东西。
这是很多的输入符 在一个经常性的时间表。
每次运行都会输出你的数据。
相去无相.
如果馆长读取了记忆 那记忆就离开了你的网络 对于一个居室来说,这是一个偏好;对于任何触及客户的工作,这是一个政策问题,你必须诚实地回答.
而失败模式则是再试再试.
托管的API的速率限制,有出事,偶尔还回退化的产出.
你3点的工作受别人的操控 这通常很好。
当曲解在第二天早上的代理行为的关键路径上时,是不好的.
模型过渡增加了更小更尖锐的烦恼.
在提供商模型版本之间移动( 对样式突起说) 有时迫使 OAuth 重新认证以解锁特定工具 c