好LLM考试是90%的陷阱

2026年8月20日1 次浏览来源:Dev.to阅读原文

上次我给我的LLM 读取订单考试 输了5次考试作者。

今天:考试是如何建立的。

结论首先——好的问题就是一纸空文。

你会想从快乐的道路开始 问谁写一个测试,然后他们开始工作。 "5箱250发货箱请" ——发货箱250,5箱.

它通过。

感觉不错 摄取.

但这是浪费的分数。

模特儿很少会失败 失败的是一切不正常 我29个问题是这样破解的:正常是最小的一组.

有意为之的 为什么"不是命令" 得到的问题最多 这个计划最糟糕的事故是运送 没人订购的东西 因此,考试应该更着眼于事故的发生。 250个货运箱的尺寸是什么?

产品名称:出品.

号码:在座。

却不是令.

问曰.

一个把"产品名称发现"当作"被检测到的订单"的程序将卡车叫在这里.

于是我植入了其中的六个:价格查询,股票查询,送货问题,问候,税务发票请求.

变化和取消是更糟糕的。

我订购了250个箱子中的5个,请只发送3个2个号码。

仅读上半部而成圆满之序.

将它当作新订单 和货物船两次。

植物陷阱也出现在目录中 这不仅仅是问题 把数据本身弄得一团糟 两种分明的胶带——从"250"开始的"48毫米和60毫米"5个出品,每盒的包装尺寸不同——50个,40个,25个,10个床单 几件松散的物品,完全没有盒子单位 只有一个原因:真实的数据已经看起来像这样了.

一个真正的产品目录总是有近于双赢的.

在一个干净的目录上进行考试,这里是发生的事情——一切都过去了.

然后你插入生产数据 它会崩溃 如果考试通过但生产有事故,那不是模型的错.

这是考试的错。

最重要的陷阱:"在它学到之后" 这个计划是学习的 人一选一相克一相能忆起. "250" — 发运箱250.

从此自动.

忏悔:我前22个问题没有学习机会。 "做一次就自动"是这个程序存在的理由,我甚至一次也没有测试过这条路径.

我迟了七个问题 那七个问题让我看到了一些可怕的东西。

学习不仅仅是一个便利特征——它可以是一个出事的特征.

陷阱一号 节目学习了"磁带=48毫米".

然后,这个到达: 磁带60,2盒 应用学到的匹配 即时和48毫米舰。

顾客说60。

明确的规格必须击败所学到的比赛。

二号陷阱 节目学习了"250=航运箱".

然后:250的尺寸是什么?

学习得越多,节目就越自信.

用这种信心读出一个问题作为命令就结束了.

不管有没有学到,一个问题就是一个问题。

都过去了 不错。

但如果我从来没有写过这些问题呢?

它会去生产 没有人知道它是否通过它们。

如何建立考试,为了先写出最糟糕的事故列表——错误的货船/货船两次/无订单的货船 对于每起事故,至少写出一个问题,以引起它 Plant 近双在数据中 写出"学习后"问题——学习导致事故的事例 正常案例最后只有几个.

反正他们都过去了 如果考试是好的,考试通过——生产就有了意外.

P.S.

全部29个问题和陷阱-laden目录都是公开的 github.com/ramses203/llm-test-harness 下一步:分级——为什么通过/分级失败会破坏你.

分享