将 Converge 评估标准与 Magister 的评估运行程序结合起来(3 层评估标准、品牌固定项、配置为候选项)

作者: coreyhaines31创建于 2026年7月23日更新于 2026年7月23日
标签enhancement

为什么 Elliot 在 Magister 中构建了一个 营销评估运行程序 (magister-marketing PR #890, 分支 codex/model-marketing-evals) — evals/ 包含候选人、品牌固定项、每个家族的评分标准、一个运行程序引擎、确定性 + 盲评分,以及证据捕获。这与我们的开放式 evals/ 框架 (#479) 相同。他的 README 明确记录了 "将通用运行程序提取到未来的独立或开源包的界限"这两个部分构成了一件事: 他的是专有的、生产集成引擎(真实的品牌固定项、鸽子安全性、模型路由);我们的则是开放的、可信度层(公开的评分标准 + 公布的人类一致性数字)。它们应该共享一个 评分标准/评审者架构,这样评审者在一个中编写就可以在另一个中运行。此问题跟踪了两者的融合。

内容来源: coreyhaines31/marketingskills