TensorFlow 代码和BERT预训模型
BERT 2020年3月11日:规模较小 BERT 型号 这是在Well-Read Students Learning Better: On the Rights of Pre-train Contracting Models (WordPiece models)中被引用的24个更小的BERT模型(英语:On the History of Pre-train Contracting models)的发行. 我们已经表明,标准BERT配方(包括模式架构和培训目标)在BERT-Base和BERT-Large以外的各种模型规模上是有效的。 较小的BERT模型是针对有限的计算资源的环境而设计的. 它们可以和最初的BERT模型一样进行微调. 然而,在知识分馏的背景下,它们最为有效,其中微调标签由更大更准确的老师来制作. 我们的目标是在计算资源较少的机构进行研究,并鼓励社区寻求创新的方向