#6338·mediapipe

YAMNet 不能检测特定的声音

作者: Naveen732创建于 2026年8月18日更新于 2026年9月9日
标签platform:webtype:others

Description

我们使用 YAMNet 模型进行实时环境声音检测。

我们在两个实现中测试了相同类型的 狗叫音频

  • Android: Kotlin 实现
  • Windows:使用 @mediapipe/tasks-audio 的 Electron 应用程序

Android/Kotlin 实现中,YAMNet 正确识别了狗叫声音,并将其分类为特定的 狗叫类别。

但是,当通过 @mediapipe/tasks-audio在 Windows 的 Electron 应用程序中使用 YAMNet 时,相同类型的狗叫声音不会被特定地分类。相反,它通常被分类为通用标签,例如:

动物
野生动物

例如,我们看到以下结果:

[Noise Check] 通用顶部:动物(得分:0.67)
[Noise Check] 通用顶部:野生动物(得分:0.59)
[Noise Check] 通用顶部:动物(得分:0.33)

预期行为

在检测相同的狗叫声音时,Electron 实现应生成与 Android/Kotlin 实现类似的特定分类。

实际行为

Android/Kotlin 实现检测到 狗叫,而 Electron/Windows 实现则倾向于将相同类型的声音分类为更通用的 动物野生动物类别。

问题

  1. 为什么 Android/Kotlin 实现可以生成特定的 狗叫预测,而 Electron/Windows 实现只能生成通用的 动物预测?
  2. 这种差异是否可能是由于 Android/Kotlin 和 Web/Electron 之间的音频输入管线的差异造成的,例如采样率、采样点数、采样时间等?

内容来源: google-ai-edge/mediapipe