#1201·open_clip

音频-文本检索评估 (AudioCaps/Clotho) 和音频前端单元测试

作者: abtonmoy创建于 2026年8月5日更新于 2026年9月16日
  1. 音频-文本检索评估模仿现有结构。 open_clip_train/audio_retrieval.py 模块的结构与 audio_zero_shot.py 相同:Hugging Face 数据集输入, --audio-retrieval-* 参数,在训练期间和独立运行时通过 scripts/clap_retrieval.py 执行 zero_shot_eval_all。将 a2t/t2a 召回(每个片段都有多个参考说明),使用 COCO 约定:音频查询对其最佳排名的参考说明进行评分。指标名称为 metrics._add_rank_metricsaudio_to_text_R@{1,5,10}, 平均/中值排名)。通过训练循环使用的相同 model(audio=...)/model(text=...) 调用,无需考虑塔,评估转换完全与零射路径选择的方式相同(NaFlex mel-patchify 与固定片段 AudioPreprocess),因此 HTSAT CLAP 和 NaFlexClap 都由一个代码路径覆盖。

内容来源: mlfoundations/open_clip