STT 可以在没有置信信号的情况下产生自信、错误标记的转录,导致无意义的输入传递到 LLM
作者: alexdimmock95创建于 2026年9月15日更新于 2026年9月16日
问题
当 STT 后端遇到不支持的音频(例如不支持或资源不足的语言)时,它可能会默默地生成标记不准确的语言和模糊/幻听的转录,没有信任指示器。这种毫无意义的文本然后会被转发给 LLM,好像它是正常的、高信任输入,从而产生混乱或无关的响应,没有向用户提供任何信号,表明问题实际上出现了哪里。这无论选择哪个 STT 后端都是如此,因为这是管道层,而不是任何单独的模型,才需要显示这种信号。
内容来源: huggingface/speech-to-speech