生产前如何评价有限责任公司

2026年8月25日3 次浏览来源:GitHub Blog阅读原文

一个语言模型可以在一个干净的基准上表现良好,并且仍然与生产中重要的案例相抗衡.

在建立基于LLM的系统时,基准和编译数据集是有用的。

它们帮助团队比较模型,测试一个初始的即时,并确定一个想法在技术上是否合理.

但随着一个系统更接近生产,评价问题也发生了变化.

实际投入往往含糊不清。

标签可能不一致。

重要背景可能缺失或被截断。

成套评价可能不反映生产分布.

在基准中很少出现的边缘情况可能成为失败的常见根源。

即使离线计量标准有所改善,这些结果也可能不能被干净地转化为生产行为。

我们在评估一个基于LLM的系统时遇到了这些挑战,这个系统旨在减少GitHub秘密扫描中的假阳性.

秘密扫描可以识别可能已经承诺给寄存器的符号和密钥等证书.

由于一些候选字符串类似秘密,但don’t实际上代表了真实的资质,开发者可能会花时间调查需要don’t补救的提醒.

与其确定LLM是否能够正确分类一个字符串,我们需要理解的是,该系统能否减少噪音警报,同时保持足够的回放,以保持安全,用于安全工作流程。

在本文中,我们分享了帮助我们从有希望的原型成果转向生产的做法。

在代码分析、开发工具、安全、数据分析和其他生产工作流程方面,这些经验教训广泛适用于LLM驱动系统。

1.

从产品决定开始,而不是当一个LLM系统按预期运行时,第一个本能往往是调整其技术组件。

团队可以重写提示,添加上下文,引入另一个推理步骤,调整周围的管道,或切换模型.

在作出任何这些改动之前,它们应界定评价旨在支持的决定。

对于我们的秘密扫描工作,我们问道:系统能否减少假阳性,同时保留足够安全的回忆,以便在生产安全工作流程中安全?

为了回答这个问题,团队必须决定哪些错误是可以接受的,哪些衡量标准应驱动产品决定,哪些护栏必须保持在其确定的阈值以内.

在秘密扫描中,不正确的压制真实的证书可能比要求开发者审查额外的警报更具有后果.

因此,我们没有将精确度和回顾度视为同样可互换的衡量标准。

我们的首要目标是减少假阳性,提高精度.

召回是一种安全限制:只有任何减少保持在预先确定的可接受的范围内,试验才能取得进展。

这给了我们一个明确的评估权衡的方法。

我们选择了在满足召回要求和满足我们行动护栏要求的同时,实现最强烈的假阳性减少的配置。

我们把评价标准分为三个层次: 这衡量了我们试图改进的用户利益: 虚假的精确性安全限制 这妨碍了明显改善,无法带来不可接受的安全风险。

这些决定了这一结果是否实际部署: 这种区别使我们无法将每个衡量标准视为可互换的。

降低假阳性但大幅降低召回率的改变是自动的改进。

提高质量同时又使系统过于缓慢、昂贵或难以整合的改变也不是如此。

考虑两个假设的实验结果: 实验精度回召延迟决定 实验 A 安全防护管下较大的改进瀑布 接受唐克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克克

分享