LangSmith对实时AI系统的调试非常出色.
但是,保持其扩展保留级的每一个跟踪,可以将可观察性变成一个令人惊讶的庞大行项.
今天,我们把一个新的存档工作流程 合并到这些变化中: 保留LangSmith进行活调试, 不断将已核实的痕迹存档到组织拥有的私人S3, 直接用 DuckDB 查询保留下来的Parquet。
换句话说,你可以保存你完整的追踪历史,而不将每一个追踪都放在LangSmith的扩展保留级上.
成本超额风险 LangSmith 目前记录了两层痕量保留: 二级留存 公布的痕量价格基础 14天 0.05 * 延长400天 总计 0.50 * * 0.45 延长保留升级使延长的跟踪成本与基准跟踪成本一样高。
每月追踪基地,14天 延期,400天 额外留存费用 100 000美元 50 500美元 450 000美元 5 000美元 4 500 10 000 000美元 5 000美元 这些例子在免费津贴、计划条款、谈判定价或税收之前使用公布的每轨费率。
在作出预算决定之前,始终要检查LangSmith的官方用途和账单文件.
还有另一个微妙的风险:在线评估员和自动化规则可以在启用保留扩展时升级匹配的痕迹.
一个匹配一跑提升整个跟踪的规则,一个线程级规则可以提升该线程中的每一个跟踪.
LangSmith目前允许在默认情况下对新的在线评价员和自动化规则进行保留扩展,尽管你可以选择退出.
因此,从规模上讲,一个看起来无辜的评估者或规则能够产生比预期大得多的帐单。
新的归档工作流程 新的工作流程将现场观察与长期保留分开: D+2 导出在正常后端数据结算后抓取痕迹.
D+12对账通道在14天基数保留窗口关闭前捕获延迟更新。
两者都通过运行的ID来进行去重复,所以重试是安全的,档案会汇合到最新的输出数据上.
结果是长期追踪历史 在存储 您的组织拥有和控制。
通往私人 S3 项目的路由可以被路由为分离出桶或前缀——例如隔离开发与生产数据: 将 CLI 指向该配置并用克龙、 Kubernetes CronJob 或您现有的调度器来安排同步: 该组织提供调度器,LangSmith API在输出时使用的密钥,AWS工作量身份,私人桶,加密,生命周期政策,以及读者IAM.
CLI拥有存档和查询机制,而不是你的基础设施。
在没有LangSmith API 存档后查询历史痕迹,仍然可以通过熟悉的命令进行搜索.
读取使用 DuckDB over Parquet 在 S3 中, 不需要 LangSmith API 键 : 这意味着事件调查,回归分析,审计,以及离线分析,在LangSmith API的活生生地消失后很长一段时间内就可以继续进行.
对于许多团队来说,一个更好的高容量追踪默认,现在最经济的模型是直截了当的:保持基础保留以进行日常调试.
在不需要自动保留扩展的情况下禁用。
在14天的窗口关闭前, 将所有线索导出到私人 S3 。
用于更早的调查和分析。
你保留了LangSmith出色的现场调试经验,保留了你自己控制的全部历史数据集,并使长期存储成本可以预测.
合并后的变动和执行说明载于Langsmith-cli PR #163.
如果你以有意义的体积操作LangSmith, 这是值得设置 在你的下一个评估或自动化规则 悄悄地乘以保留账单之前.