BertWordPieceTokenizer 在加载词汇表时忽略 wordpieces_prefix
作者: HaokaiDing创建于 2026年9月16日更新于 2026年9月16日
`BertWordPieceTokenizer(..., wordpieces_prefix="@@")` 将 decoder 配置为 `@@`,但底层的 WordPiece 模型保留了默认的 `##` 前缀。因此,包含自定义前缀子词的词汇表会将已知文本编码为 `[UNK]`。
内容来源: huggingface/tokenizers