使用带有子词编码的 CTC 束搜索解码器。
作者: DomainFlag创建于 2022年10月12日更新于 2024年7月10日
我使用了 `generate_scorer_package` 提供的评分器生成器。我也使用了 (例如 SentencePiece) 构建一个单元语言模型,其中解码器预测了语言模型的大小。我如何调整评分器,使其支持子词单位?如果将子词单位填充到字母表文件中,评分器是否会正常工作?或者我是否应该依赖一些技巧,例如使用 ASCII 表对单元语言模型进行编码,然后重新对语料库进行编码,并使用基于之前的编码映射的字母表?谢谢。
内容来源: mozilla/DeepSpeech