Eval 摘要通过计数与行级结果不匹配

作者: pamelafox创建于 2026年6月12日更新于 2026年6月17日

问题\n在已提交的评估结果中,summary.json 可能与 eval_results.jsonl 不一致,对于 gpt_relevance 通过次数。例如,具有 gpt_relevance: 3.0relevance_threshold: 3 的行被标记为 relevance_result: pass,但摘要报告的通过次数较少(例如 47/50 而不是 50/50)。\n\n## 预期行为\nsummary.jsoneval_results.jsonl 应使用相同的通过/不通过规则,并报告一致的次数。\n\n## 说明\n这似乎是评估器/流程问题,而不是与刷新历史评估结果的 PR 相关的问题。

内容来源: Azure-Samples/azure-search-openai-demo