#1410·bert

预训练对微调和推理的影响

作者: Hu-Pen-Chih创建于 2024年7月11日更新于 2025年2月27日

目前我正在处理一个二元预测分类任务,主要集中在微调 BERT 模型以学习 CVE 和 CWE 之间的关联。我将此任务分为三个阶段:首先,使用大型的 CVE 和 CWE 数据集进行 MLM 预训练;然后使用预训练的模型权重进行微调;最后,使用针对任务特定的权重进行推理。对于推理,我随机选择 100 对 CVE 供模型进行预测,仅保留模型权重并将模型设置为 `model.eval()`。然而,我在将预训练模型转换为微调模型后,评估指标显著提高(准确率、精度、召回率、F1 分数),并且训练和验证损失都大幅下降。然而,当我使用微调模型权重进行推理时,准确率反而比之前更低。我不确定这种差异的原因。此外,以下是用于预训练和微调的超参数:

内容来源: google-research/bert