Agent Core 评估: AWS 如何使用 OpenTeleometry 作为合同构建框架- 可知 Eval 层

2026年8月27日1 次浏览来源:Dev.to阅读原文

Amazon Bedrock Agent Core Experiments解决了一个真正的问题:你在LangGraph上建造了特工,你的队友使用LlamaIndex,平台团队正在实验OpenAI Agents SDK.

每个框架都有自己的评价故事,没有一个框架相互交谈。

AWS的答案是将"OpenTeleomet"遥测作为评价合同.

如果你的代理人发出正确的跨度和属性,Agent Core可以在不知道您使用的哪个框架的情况下给它打分.

该服务与LangGraph,LlamaIndex,OpenAI Agents SDK,Google ADK,克洛德Agent SDK,和斯特兰德斯Agents合作.

它也和自定义堆栈一起工作,只要你正确使用它们.

这是第一个利用遥测合同将代理评价与框架选择脱钩的主要云供应商。

水管是这样工作的 OpenTeleometter Contract Agent Core Evaluations期望代理以OpenTeleometry格式放出结构化的遥测.

服务寻找特定跨度类型和属性: Agent 跨度:用于单个代理引用工具调用时的顶级执行上下文 跨度:个人工具调用,包括输入,输出,和即时LLM 跨度:具有即时,应答,令牌计数,以及模式ID检索时长的模型调用:矢量搜索或知识库查询 每个跨度必须包含向评价维度映射的语义属性.

例如: 关键洞察力是,Core探员并不关心你框架的内部状态机器或图表结构.

它只关心可观察到的事件:什么叫做工具,LLM说些什么,需要多长时间,以及它们是否成功.

框架适配器和仪器差距 多数流行的框架已经释放出一些开放遥测,但覆盖范围各不相同: 框架原生OTel 支持仪器差距 工作环绕 LangGraph 部分(LangSmith 集成) 缺少工具成功/失效属性 手册横跨浓缩 LlamaIndex Good(建造在OTel出口商) 不一致的跨度 命名 Span 处理器 使 OpenAI Agents SDK 最小化 默认工具 无法跨度 使用自定义跟踪器 Claude Agent SDK None Everything 手动仪器 自定义堆栈 如果你的框架没有发出所需的遥测,你有三种选择: 手动仪表: 用 OpenTeleometry API 包装您的代理代码,称为 Auto-institution: 使用 OpenTeleometry 的自动仪器库进行 HTTP, 数据库, LLM 调用 Span 处理器 : 在它们被创建后,但是在被输出之前,AWS并不能提供特定框架的 shims.

你负责确保你的探员发出正确的遥测形状 文档包括每个支持框架的示例仪器,但您需要将其适应您特定的代理架构.

一旦AgentCore得到遥测,它就会计算出跨越多个维度的度量: 任务成功率: 没有出错的代理运行百分比 代理商是否在正确的顺序中调用正确的工具 响应: LLM-as-judge 对照地面真理 Latency对最终输出的评分: P50, P95,和 P99 代理运行,工具调用, LLM 调用 Cost: Token 使用量和每次运行的估计推论成本 服务存储评价的结果是一个时间序列数据库(可能是亚马逊时间流,尽管AWS没有具体说明).

您可以通过 AgentCore API 查询结果或在 AWS 控制台查看结果 。

预留90天.

之后,如果想要长期存储,需要将结果导出至S3.

部署形状和数据流 以下是典型的数据流: 您的代理在您的 AWS 账户中运行( Lambda, ECS, EC2, 或 on- prem) OpenTeleometry SDK批次跨出并导出到AWS Distro for OpenTeleometry (ADOT) 收集器 ADOT 收集器通过 AWS PrivateLink Agent Core 进程转发给 Agent Core 评价器 跨出并计算度量衡并存储结果 您通过 A 查询结果

分享