当输入为 tsv 文件时,高频词汇被分割为字母序列
作者: TingxunShi创建于 2024年1月30日更新于 2026年8月3日
标签bug
你好, 目前我需要训练一个 SP 模型。由于输入文件过大(约 80G, 500M 行), 我将程序设置为使用 tsv 文件而不是原始文本文件作为输入。输入文件的格式很简单, 就是"词\t频率"。我使用 unigram-lm 训练了模型。训练后, 我发现一些短但频率高的词被分词成字符序列。以下是一个示例:
内容来源: google/sentencepiece