#15482·Speech

在变更 SubSampling 和 VGG 前端的预编码缓存大小时,计算 drop_extra_pre_encoded 存在问题

作者: qocharian创建于 2026年3月10日更新于 2026年9月15日
标签bugcommunity-requestwaiting-on-maintainers

问题描述

在当前的流式编码器实现中,前端(ConvSubsampling)使用两个参数:pre_encode_cache_size(输入帧中左上下文的大小)和drop_extra_pre_encoded(在采样后丢弃的令牌数量,以消除此上下文的影响)。

对于ConvSubsampling,drop_extra_pre_encoded的计算公式如下:公式: drop_extra_pre_encoded = 1 + (pre_encode_cache_size - 1) // subsampling_factor

内容来源: NVIDIA-NeMo/Speech