实施深研究型评价
作者: yiouli创建于 2026年3月22日更新于 2026年9月8日
标签needs-maintainer-decision
□ 问题
为了提高GPT-研究者的研究质量,需要有一种适当衡量研究质量的方法. 虽然该项目中有现有的评价单元,但它们与关于研究质量的目标(全面、无偏见和事实)不符,因此无法为研究质量的提高提供多多的指导。
□提议
以[深入研究Gym评价协议]取代现有的评价执行(https://GitHub.com/cxcscmu/deepresch benchmarking)。
并使用[研究问 (https://huggingface.co/datasets/corbyrosset/researchy questions]),[深入研究座 (https://GitHub.com/Ayanami0730/deep research bench),以及ServiceNow DRBench作为评价研究质量的基准.
□ 未来潜在项目
一旦建立了经改进的评价,就能优化质量。 一些想法:
- 使用 GEPA + 少许shots Bootstrap(来自 DSPy) 来优化提示
- 支持社区整理的数据集,以便有针对性地优化
- 添加功能,让用户用自己的数据优化其GTPR实例
□ 附录:现有eval模块的错配
SimpleQAEval正在判断研究结果是否包含一个具体而近乎问题的确切答案. 但研究的要点不是找到一个封闭式问题的答案,而是更多关于事实,无偏见和全面的信息探索.
由于LLM裁判员缺乏对基础真相数据的获取,评价结果无法真正反映研究成果的潜在偏差/真实性.
内容来源: assafelovic/gpt-researcher