如何避免 Benchmark 成为“记忆游戏”

Author: wangzizheCreated Sep 10, 2026Updated Sep 10, 2026

读完了第七章关于 Agent 评估的内容,有一个问题最近一直困扰着我:公开 Benchmark 如何避免被污染?

很多 LLM / Agent Benchmark 都是公开的,这样方便大家复现和比较。但长期来看,这些数据很可能进入后续模型的预训练或后训练数据中,评测也可能逐渐从“能力测试”变成“记忆测试”。

我自己也遇到了这个问题。我在物理建模领域构造了一个面向 Agent 的评测数据集,现在不知道应该如何发布。如果开源,别人使用方便,但很快就会成为记忆游戏;如果不公开,别人又很难复现和使用。

所以想请教作者和大家:Benchmark 在开放性和防污染之间,如何获得最大平衡? 也想听听对未来评测方式的看法。

PS:我目前想到的一种方法,是把数据集部署在服务器上,让其他人的 Agent 直接在服务器上进行评测,这样他们看不到数据集本身。但我又担心,Agent 在评测过程中仍然可能把测试数据提取出来,最终还是会造成泄漏。