图像聚合器要求 LLM 猜测 experiment_data.npy 结构 → 空的图像集无法通过 5 次反射修复;在提示中附上真实的数据结构说明

作者: Goldenmonstew创建于 2026年6月12日更新于 2026年6月12日

> 相关问题: 没有找到现有问题(搜索:聚合器,图表,npy,图表,空)。## 摘要`aggregate_plots`通过要求 LLM 编写一个 Python 脚本来构建最终论文图表,该脚本加载运行的`experiment_data.npy`文件。提示仅包含阶段摘要(其中包括`.npy`路径) - 从来没有这些文件的内容/结构。实际上,每个`experiment_data.npy`都是一个pickled dict,其中包含运行特定的,不可预测的顶级键(每个数据集/变体/剔除/种子一个)和异构的值形状(标量,列表,列表的字典,嵌套字典)。因此,LLM硬编码了猜测的键;生成的脚本运行完成,退出代码为0,但生成的图表为零或空白,而反射循环 - 只能看到图表数量和脚本的标准输出,而不是数据 - 无法恢复。## 位置当前的`main`(96bd516),"ai_scientist/perform_plotting.py":-`build_aggregator_prompt`(第52-86行) - 仅有数据相关的指导是路径级别:Python重要:聚合器脚本必须从"exp_results_npy_files"字段中加载现有的.npy实验数据(仅使用摘要JSON中的完整和确切文件路径)以进行全面的绘图。...4)不要幻想数据。数据必须要么从.npy文件中加载,要么从JSON摘要中复制。-`aggregate_plots`(第136-156行)加载想法文本和摘要,构建此提示,并运行多达`n_reflections: int = 5`个反射轮次(第137行)。反射提示(第203-219行)仅反馈`figure_count`和脚本的输出 - 因此,当根本原因是"脚本迭代了一个不存在或匹配不到的猜测键"时,每个反射轮次都重复了相同的猜测。- 根据退出代码单独发出成功日志("成功运行"),即使`figures/`最终没有非空图表。## 影响量以多次运行的重现活动为度量: - 一次代表性聚合:输入的.npy文件一起包含了**37个不同的顶级键**(异构的数据集/剔除);生成的聚合器硬编码了一个猜测的合成数据集键,"成功运行",并生成了**在所有5个反射轮次中**0个可用图表。 - 在仅通过提示更改后 - 将每个.npy的实际结构(顶级键以及每个值的类型、长度和形状)放入提示中并指示动态键迭代 - 对于相同的运行,第一次尝试生成了8-9个有效图表,没有其他更改。 - 下游影响严重:如果`figures/`为空,写作阶段将生成一个没有结果图表的论文(或幻想它们)。## 重现大纲1.完成一个BFTS运行,其阶段生成了具有多个顶级键的`experiment_data.npy`文件(任何多数据集或剔除密集的想法都会自然地这样做)。2.运行`aggregate_plots`作为启动程序所做的。3.检查

内容来源: SakanaAI/AI-Scientist-v2