YAMNet 不能检测特定的声音
作者: Naveen732创建于 2026年8月18日更新于 2026年9月9日
标签platform:webtype:others
Description
我们使用 YAMNet 模型进行实时环境声音检测。
我们在两个实现中测试了相同类型的 狗叫音频:
- Android: Kotlin 实现
- Windows:使用
@mediapipe/tasks-audio的 Electron 应用程序
在 Android/Kotlin 实现中,YAMNet 正确识别了狗叫声音,并将其分类为特定的 狗叫类别。
但是,当通过 @mediapipe/tasks-audio在 Windows 的 Electron 应用程序中使用 YAMNet 时,相同类型的狗叫声音不会被特定地分类。相反,它通常被分类为通用标签,例如:
动物
野生动物例如,我们看到以下结果:
[Noise Check] 通用顶部:动物(得分:0.67)
[Noise Check] 通用顶部:野生动物(得分:0.59)
[Noise Check] 通用顶部:动物(得分:0.33)预期行为
在检测相同的狗叫声音时,Electron 实现应生成与 Android/Kotlin 实现类似的特定分类。
实际行为
Android/Kotlin 实现检测到 狗叫,而 Electron/Windows 实现则倾向于将相同类型的声音分类为更通用的 动物或 野生动物类别。
问题
- 为什么 Android/Kotlin 实现可以生成特定的
狗叫预测,而 Electron/Windows 实现只能生成通用的动物预测? - 这种差异是否可能是由于 Android/Kotlin 和 Web/Electron 之间的音频输入管线的差异造成的,例如采样率、采样点数、采样时间等?
内容来源: google-ai-edge/mediapipe