Evals是评估LLMS和LLM系统的框架,也是基准的开源登记册.
OpenAI 爱瓦尔 您现在可以在 OpenAI Dashboard 中直接配置和运行 Evals 。 Get start → Evals为评价大型语言模型(LLMs)或使用LLMs构建的系统提供了一个框架. 我们提供一个现有的 evals 注册,测试不同维度的 OpenAI 模型 和写自己定制的 eval 的能力,用于您所关心的案件。 您也可以使用您的数据来构建代表您工作流程中常见的 LLMS 模式的私有 evals,而不公开披露其中的任何数据 。 如果你是用LLMs构建的, 创造出高质量的 evals 是你能做的最具影响力的事情之一。 没有evals,理解不同的模型版本会如何影响你的使用案例可能非常困难和时间密集. 用OpenAI主席格雷格·布洛克曼的话来说: 要运行 evals, 您需要设置并指定您的 OpenAI API 密钥 。 在你拿到APIK后..