对附录E基准的澄清:问题召回基本真相和计算匹配

作者: innercartography创建于 2026年9月2日更新于 2026年9月2日

上下文——我正在对附录E控制基准的小规模试点进行范围界定,并在当地的阅纸社区进行. 不作复制:大约从一单ML子场出6个草稿,5个条件中的4个(单模自体,同型双剂,跨模,跨模倒置),有3个被蒙蔽的评分. 目的是建立一个可行的地面真实程序,一个有衡量的双方协议数字的评级标题,以及一个现实的成本估计,因此,进行全面研究的任何人都从手头的那些开始。 注意前方的Repo显然已经超越了论文中的v0.4快照,所以我欢迎知道你的想法是否也移了.

  1. 问题召回——附录E名称问题召回作为衡量标准,这意味着每个草案都有一套参考问题。 你怎么设想这组建筑的? 由专家撰写或裁定的成套问题、原始缺陷、不同条件的调查结果的结合或其他问题? 提出疑问是因为以工会为基础的提法似乎可以奖励仅仅产生更多候选人的条件,而原始缺陷可能与真正草案中出现的失败不相上下。

  2. 计算匹配 - 打算在不同条件下保持多少数量大致不变? 托肯斯,推论成本,审查员的呼叫计数,墙上钟等. 工作合同明确规定,审查人员级别从不努力运作,审查人员的工作量和推理深度是独立的轴心。 这种分离似乎使选择匹配单位成为比较的结果。

法医在.aris/traces/中的检查痕迹看起来会给一个精确的评分板来评分——你是否把这些看成合理的依据? 很乐意分享飞行员生产的一切.

内容来源: wanshuiyin/Auto-claude-code-research-in-sleep