将 JudgeLM 添加为评估和比较历史测试运行的方式
作者: penguine-ip创建于 2023年10月30日更新于 2026年9月15日
标签enhancementhelp wanted
目前,指标是基于评估期间运行的测试用例计算的。但是,目前没有办法比较历史测试运行的性能,除比较每个测试运行的指标分数外。我想介绍另一种选择最佳配置/超参数的方法,以帮助开发人员利用 DeepEval 加快开发速度,那就是实现JudgeLM(例如 https://GitHub.com/baaivision/JudgeLM),从一组测试运行中选择最佳测试运行。
内容来源: confident-ai/deepeval