[ 严重错误 ] 在深度研究代理程序中通过搜索工具泄露答案(搜索时数据污染)

作者: lezhang7创建于 2026年4月8日更新于 2026年4月23日

描述: 在测试深度研究代理 (DRA) 在 HLE 数据集上时,我发现了当前评估协议中的一个重大缺陷。由于官方代码并未明确限制模型在搜索过程中访问基准自己的数据或其未加密的镜像,模型可以 – 而且通常会 – 在搜索过程中"污染数据"。

内容来源: Alibaba-NLP/DeepResearch