9个LLM评论员每篇我发表的文章都得分.
大门很简单: 零阻塞器,还有我地板上的一个平分.
昨天,它失败了 一篇它得分9.1。
然后,它失败了第二 三次独立的。
两位评论员都从未对写作表示过异议——这三起失败都是对自己的审查员的错误解读.
一个完美的分数,作为阻断器存档 核对表审查员返回了10.0,并在以下写道: 这是一个干净的健康法案。
它辜负了大门。
解析器抛出"这里什么都没有"的行.
即时报要求审查人员解释为什么什么也没有出错,所以他们写的解释代替了""字"——"没有传记"不是"没有".
为什么它能活下来的审查:regex对于它被写成的被反对的字符串是正确的.
没有人写一个测试的句子 一个模型没有发射。
修补的不是更长时间的regex。
猜想"无所事事"的每句话都是没有界限的.
这些提示已经说明了合同——完全在范围上意味着并且——所以10个同样报告阻断者是自相矛盾的: 被除名,没有被删除。
如果评论员在真正被打破的东西上评分为10,那么文字仍然会到达人类身上.
使好评的词看起来像停用 我的跑者将配额信息视为运输故障,因此计费错误永远不能被评为坏文章.
模式包括赤裸裸 根据审查员的全部产出进行了测试。
我的炸弹是安全物品 评论家们经常说: 3个完成评论,在被丢弃的文本中可见得分.
这篇文章损失了9个审查员中的4个, 在我查之前两批都失败了。
它认为这是一个账户问题,这正是它生存的原因。
剧情将两者区分开来:真正"配额"标语是唯一在"Stdout"上的东西.
仅仅讨论限制的回顾就有一个线。
一个被排斥在外的评审员投票,一个评审员是信息——它的分量品牌适配了40%,这在结构上限制了任何超出这一优势的事物。
它被排除出门分数。
它没有被排除在阻塞器之外。
因此,它通过后门否决了——它所记录的是它自己的算术:在它刚刚称之为原创和可再生的文章上有四个"阻塞".
一个半应用的排除并不是一个排除——一个加权复合体正是隐藏一个的形状,因为算术看起来就像一个发现.
这些图案中每一个都是把协议误认为是分歧, 所有三个都失败在同一个方向:悄悄地,走向拒绝。
一个错误的通行证是响亮的——一些坏船,你可以看到它。
错误的失败看起来就像一个严格的门 做它的工作,所以它可以运行 几个星期,而你假设 工作只是不够好。
正是同样的不对称使得领板在取悦方向上出现错误,同样的原因测量偏差在与你预期的一致时活得最长.
如果你作为一名法官运行 LLM , 断言它从逻辑上讲不可能有的分歧: 完美得分与阻断器, 被排除在仍被阻断的分数之外的审查器, 运输错误, 带有解析结果 。
这些是自相矛盾的,而自相矛盾是可以检验的,而不预言模型会说出一个单词.
两个方向 一个片面的测试本可以通过所有三个错误——我之前对相反的失败的修补就是引入了第二个错误.
这是同样的经验 地面的真理教会了我 单位测试不能: 从你已经知道的失败中写出来的测试 只能证明你修好了它。
在github.com/ofri-peretz/eslint上, 以上3个缺陷被发现于2026-08-11,跨越了39个出入口的文章.
你在自己的工具中发现的最后一个假底片是什么——它运行了多久?