#2412·tokenizers

BertWordPieceTokenizer 在加载词汇表时忽略 wordpieces_prefix

作者: HaokaiDing创建于 2026年9月16日更新于 2026年9月16日

`BertWordPieceTokenizer(..., wordpieces_prefix="@@")` 将 decoder 配置为 `@@`,但底层的 WordPiece 模型保留了默认的 `##` 前缀。因此,包含自定义前缀子词的词汇表会将已知文本编码为 `[UNK]`。

内容来源: huggingface/tokenizers