# Blog 10:Minecraft Mod Agent - 我让我的AI Agent Judge Itself - 使用分数让它成为更好的战斗顾问

2026年8月1日2 次浏览来源:Dev.to阅读原文

博客10:Minecraft Mod Agent——我让我的AI Agent Judge Itself——使用分数使它成为更好的战斗顾问 Cloud Swords Mod——Blog 10 in Blog 9,我给我的Minecraft Mod一个AI大脑.

一个斯特兰德斯特工 根据你的战斗情况决定 有多少盟友来召唤 它的工作原理。

但"工作"不是衡量标准.

我怎么知道AI在做好决定?

当玩家有3个心和8个僵尸接近时,代理召唤5个盟友(正确)还是1个(死刑)?

当玩家完全健康而无威胁时,它是否正确地什么都不做——或者浪费资源无故召唤走狗?

我需要一个评估框架。

所以我建了一个 那个法官呢?

另一个AI。

问题:非决定性决定 毒剂使用.

相同的输入可以在调用之间产生略有不同的输出.

因为没有单一的正确答案,所以不能写作.

你能评价什么:动作是否有效JSON? (决定性检查) 行动在限度内吗? (一至五百万,有效布法类型) 反应是否与威胁相称? (需要判决) 推理一致吗? (需要判决) 前二为通相.

最后两个需要LLM.

Eval Dataset: 真实互动 还记得模拟服务器吗 ?

每次代理商做出决定,都会被记录: 我接受了20+真实的交互,并增加了预期的行为范围: 第1级:代码评价者(自由,即时) 这些问题立即捕捉到60%的问题:JSON畸形,出界值,缺失原因,异常不成比例的反应.

二级:LLM-as-Judge 对于主观的东西——"这是个好决定吗"——我和法官一样使用同样的模式: 元部分:作出决策的同一种AI模式也在评判它们.

这样做是有效的,因为法官有预期的行为作为参考——并不是在真空中进行评估.

Eval 运行器 A/B 测试系统提示 真正的力量:我可以测试不同的系统 提示和测量哪个能产生更好的决定。

Express B在Nether的情况下得分较高,因为它明确考虑到生物危险。

这种洞察力来自Eval——而不是来自气氛。

反馈循环 这是LLMOps系列(第3部分:Eval-Driven Development)的同一条回路——但应用于Minecraft mod.

模式是普遍的。

结果:我运行了20种情景后发现的: Metric Super v1 Super v2(生物意识)代码通过率 95% 95% 威胁评估 7.2/10 8.4/10 相称性 6.8/10 8.1/10 合理质量 7.5/10 7.8/10 生物群落意识迅速使威胁评估改进了1.2分,特别是在Nether和End两种情况中,v1反应不足。 5%的密码故障率?

JSON在模型偶尔会在JSON之前添加解释文本时解析出问题.

通过使解析器更坚固来固定(先查找后查找).

Cloud/AI Conceptions Eval Concepture What it 教给代码评价员 输入验证 计划执行 LLM-as-Judge AI 评价AI(元评价) Eval数据集 测试非定断系统 A/B测试案例 实验提示 数据驱动决定 反馈循环 持续改进 可观察性分数阈值 质量门 SLOs用于AI 交互.json可观察性 审计线索 我在CI中做下一个自动电子测试 – 每一次快速变化触发 eval,如果分数下降 玩家反馈 – 在每次云引用后拇指上下调 –反馈到数据集季度提示 –不同游戏阶段(早/中/终游戏)的不同系统提示 –测试gpt-os:20bs Claude Haiku vs Nova Lite 成本/质量交易 Full Picture Cross 10个博客文章中,这个mod从"有云名的七剑"发展到一个全系统: 用有 BFS 算法的 Python + AI Energy 系统生成的自定义纹理 使用自定义 GUI 的多块机 A 拼写系统 28个拼写系统 Armor set with Deswitch 力学商 有精英进取 A 服务器无 AI 后端 A AI 判断的评价框架 所有通过游戏教授云计算

分享