MCP工具应该返回什么? 我做了72次审判 而不是争论

2026年8月7日2 次浏览来源:Dev.to阅读原文

现在有关于MCP的争论 你可能见过:一个叫"MCP已死"的400分线程,里面有真实的代号,四个连接的服务器在有人问问题前会吃到21,077个上下文的代号.

争论在于MCP的成本.

几乎没有人在其中测量了 一种工具返回的数据的代理。

我最终测量了它,不是因为我计划, 而是因为一个维护者拒绝让我猜猜.

没有人想用我给 CNCF Jaeger的MCP服务器提供的意见来回答这个问题。

去年4月,我提议将服务性能衡量标准(延迟、呼叫率、出错率)作为MCP工具,并直接击中一个设计叉:产出应该是什么形状?

选择一,汇总行:每服务预汇总数据,紧凑,便宜.

选项 二,每桶时间序列:生分,按默认分辨率,每服务约720个,价格昂贵但完成.

我问维护者喜欢哪个 从问题线索逐字回答: 这种类型的决定不应该基于意见,而应该基于一个真正的代理解决一些问题并使用这个MCP工具访问度量衡的基准,在那里你可以对不同的输出格式进行A/B测试.

不错 于是我建立了A/B。下面的布置都是在jaeger-mcp-bench公开的, 包括绳子,任务,计分器,以及所有出错的研究日志。

固定是Jaeger v2 有横断面连接器 热杆产生流量 后面的普罗米修斯 在度量衡前,API坐着一个很薄的长凳服务器,完全有一个开关:.

没有新的语义学,只是回想出来的形状. 6个故障排除任务,以及这一部分重要:选择3个是因为我预测摘要会赢得它们(点问题:当前延迟,排名,阈值检查),3个是因为我预测系列会赢得(时间问题:突起检测,相关性,趋势).

设计任务以利双臂 使甲板不受你的假设影响 两个特工,而不是被剥去的工具循环:克洛德·索内通过克洛德代码CLI和双子座2.5 Pro通过Gemini CLI, 真正的系统提示和所有, 因为这就是生产剂实际上。

每个牢房进行三次试验,总共72次试验,细胞按随机排列顺序运行(种子42),因此固定漂移不能与任何一只手臂相通.

分心是针对地面真理的 而不是气氛 72次试验说手臂正确错误 拒绝Claude / 系列 18 0 Gemini / 系列 17 0 1 Claude / 汇总 10 1 7 Gemini / 汇总 11 0 7 我期望的结果是错误的答案.

格式不好,结论错误,代理行为尴尬,故事不错.

事情不是这样的。

在72起试验中,完全有一个错误的承诺,它追溯到我自己的长凳服务器上的一个错误,而不是格式(在ResULTS.md中披露;它偏向摘要,我宁愿报告自己的错误而不是假发现).

实际差异存在于下降率.

鉴于摘要行,代理商说出一些"我无法从现有数据中确定这一点"的版本比系列多出7倍,几乎完全针对时间问题.

它们应该会下降: 集合摧毁了问题所需要的时间轴。

您无法平均确定一个峰值 。

特工们不会误会你喂得不够 他们放弃,礼貌和正确。

数据在更正下保持:Claude的汇总与序列差距在Bonferroni之后是很大的(p=0.001对0.0125α).

双子座,在p=0.016位,坐正于边界上,我宁可说出这段话来,而不是为我的利益而圆.

点问是一个洗涤,完全如所预测:当问题需要一个数字时,格式不重要.

所以系列赢了。

但这不是有用的教训 工具以每桶系列作为决定 由数据而不是我的口味支持 精细。

有用的教训是 关于什么"昂贵的输出"

分享