我给我的LLM 29问题阅读考试。
上次是怎样建立考试。
今日:分级.
渐渐获得自己的职位是有原因的.
建档错分 得分归你 29个中5个错了——我能发船吗?
不知所终.
因为"哪5"不见了.
如果它错过了5个打字问题,就把它运走.
但是如果其中之一 读"请取消我的命令" 作为一个新命令?
然后,即使其他一切完美, 你无法飞船。
那个程序把货物寄给刚刚取消的客户 故别分数.
按严重程度划分。
严重性="人类能消除吗?" 我的年级有4个年级 一个标准——它是可逆转的吗?
在这个计划中,不可逆的时刻是错误的货物被装上卡车.
其中一条原则是:错误的确认比没有确认更糟糕。
听起来很明显 在制作中你会想翻转它 有人抱怨"它要求确认太频繁",所以你降低信心栏.
屏幕变干净了 事故开始在屏幕外发生 同为28/29分出两道同分.
相相缘相.
两次事故,我的年级生造成的 年级生是我写的代码 就像我写的所有代码一样 它有虫子 事故一——格式化后零分.
一个模型的答案在内容上是完美的,但JSON包装机随着尾巴被切断而来.
分级者裁定"断格式=致命".
一个100分的回答, 零过一个缺失的牙套。
固定简单:倒数开口的括号并关闭所缺少的东西(在字符串内加亮出括号).
实际代码在repo中的parse json.
二号事故——惩罚好答案.
对于"250个盒子,5个单元",模型回答: 判断:需要确认 可能的候选人: 250 运输盒 原因:如果"单元"表示箱是5个盒;如果被单,0.1个盒——不能确认一个体贴的答案——要求确认并给出提示.
但我的分级员看到候选球场填满并裁定"啊哈,你确认!" 答错.
我修好了它,先看判决现场 课:当年级生出错时,最后会"修补"出"健康的模特".
而一切修行更恶.
两个操作提示 保存每个模型对文件的答复 。
永远不要扔掉 在这个计划中,不断改变的不是模型的答案——是分级的一面.
我修了三次答案钥匙 和两次分级 每个固定意味着所有29个问题的分级.
有了保存的答案,复级需要几秒钟.
没有他们,一个再级意味着再次给模型打电话29次.
这是重新标记所储存的答题表和召回每个学生重新参加考试的区别.
我把它建成一面旗帜 在每个案件后将结果写入磁盘 。
在另一个实验中,我收集了5,578件物品,并进行了节能设计.
最后一项请求失败并带走了全部5000人.
付费API——所有丢失的物品都是钱.
学会了这个艰难的方法。
外卖 当结果出现时,问题不是"有多少人得到了正确?" 这是"在失败中,什么是不可逆转的?" 这就是为什么我只读过一行 年级的输出。
致命=0:为船.
致命=1:不要——即使其他一切都是完美的.
P.
S.
Next up: 3x再用一个问题赢得的模型.
所有代码和29个问题都是公开的 – github.com/ramses203/llm-test-harness