我做了一个代理 修复不良测试。 我在我自己的尺子里发现了八个虫子.

2026年9月1日2 次浏览来源:Dev.to阅读原文

以下是Python函数及其测试.

测试给你47%的线覆盖率。

它给你9.5%的突变杀分。

这把绳子使这个模块有21个小故障 套房通知2个 这个缺口是我开始这个项目的原因。

线路覆盖范围是大部分行业的默认测试质量信号,它衡量一条线路是否运行.

它不衡量如果线路出错会有什么抱怨。

AI生成的测试异常地能产生出这种形状:高覆盖率,低检测.

突变测试量出真实的东西。

你以小方式破解了密码,并检查测试是否通知.

如果没有测试失败, 那是你套房无法检测的错误 。

它一直坐在那里。

突变测试从未进入主流 我认为原因很简单 它给你一堵幸存的变种人墙 并且没有修补他们的任何一条路 它告诉你,你有问题 然后离开。

因此,这个想法是一个代理关闭了循环。

寻取生还.

写下能杀死他们的测试 门每个生成一个硬性标准上的测试:只有当它通过干净的代码,在变种人上失败时才会保留.

地心真理是一个子进程退出代码.

没有任何模式判断结果。

我建造了大约30小时的微1前沿工程挑战赛 大约有7800名登记者 工具起作用了,有点。

它不完整,我会得到的数字。

但这不是周末有趣的部分。

有趣的是 我的测量仪器一直骗我 它一直骗我 这个发现打破了我自己的前提 在我做一个代理电话之前, 我运行了12个被广泛使用, 维护良好的Python图书馆: 缓存工具, 验证器,纳图克, dictdiffer,工具z, 活泼, 活泼,活泼,活泼,活泼,活泼。 455个变种产生. 133人在现有的测试套房幸存下来。

然后,我检查了一些东西,我以为 我不需要检查。

在这133名幸存者中,有多少人坐在实际执行的测试线上?

53.

其余从未运行。

不虚而验.

未审.

我怀疑我的测试指令范围太窄 所以我把每个目标都放大了 增加了6到40倍的测试码 如果"执行者但不断言"的分类是真实的 而我只是错过了它,这个数字应该会上升。

它从54到53。

下来 如果拓宽改变了任何东西, 它将无法到达的突变直接转化为杀戮。

它没有将他们列入中间类别。

它跳过它。

因此,在成熟的,由人书写的"活字"(Python)中,空虚的测试失败模式是罕见的.

如果这些套房失败,它们就因为完全不运行代码而失败.

我所吸收的关于执行一切的测试 和断言什么 是一个关于AI生成测试的故事。

这不是关于人类的故事。

在建造主要部分之前,我不得不重新设计项目。

这是第一个迹象,我所建造的是一个测量仪器,我没有把它当作一个仪器。

乐器中的8个bug 每一个都会产生一个自信,错误,可以公布的号码.

可编辑的安装使突变变得不可见.

在 src-layout 包上解决导入返回原始的退出。

我的突变被写成临时拷贝 所以从未被处决 3个目标无声得分0.000分.

这读作"代理在src-layout包上失败",这是一个发现.

这不是真的 货币腐蚀了一个目标。

平行运行的变种人给了我三套不同的幸存者 跨越了四道跑道, 在一个目标上 做真正的Aync I/O。我已经起草了一个“0.27到0.77”的结果。

这是噪音。

注意它指的是什么:虚伪的失败被算作是杀戮,而杀戮是每一只手臂试图增加的数量.

文件拾取者选择了错误的测试文件 。

在最困难的目标。

也就是说,这个模型本来会在

分享