音频-文本检索评估 (AudioCaps/Clotho) 和音频前端单元测试
作者: abtonmoy创建于 2026年8月5日更新于 2026年9月16日
- 音频-文本检索评估模仿现有结构。
open_clip_train/audio_retrieval.py模块的结构与audio_zero_shot.py相同:Hugging Face 数据集输入,--audio-retrieval-*参数,在训练期间和独立运行时通过scripts/clap_retrieval.py执行zero_shot_eval_all。将 a2t/t2a 召回(每个片段都有多个参考说明),使用 COCO 约定:音频查询对其最佳排名的参考说明进行评分。指标名称为metrics._add_rank_metrics(audio_to_text_R@{1,5,10}, 平均/中值排名)。通过训练循环使用的相同model(audio=...)/model(text=...)调用,无需考虑塔,评估转换完全与零射路径选择的方式相同(NaFlex mel-patchify 与固定片段AudioPreprocess),因此 HTSAT CLAP 和 NaFlexClap 都由一个代码路径覆盖。
内容来源: mlfoundations/open_clip