建议为 hv-analysis 固化「三档信息标注」规则(附四份报告实测证据)

Author: whq217Created Sep 7, 2026Updated Sep 7, 2026

你好卡兹克,我是横纵分析法的使用者。最近用这套方法跑了四份报告(一个 AI 工具、一个新岗位、一个争议人物、一个平台),过程中发现一个值得反馈的现象,附上实测证据和一个改进方案,供参考。

一、发现:标注纪律时有时无

四份报告里,【硬事实】/【有争议】/【暂缺】这套标注只在其中一份(争议人物研究对象)里系统性出现过——开头有阅读须知声明,全文十余处逐句挂钩,未决司法一律写「尚未认定」,做得非常完整。

但另外三份(包括两个不同模型跑的同一题目)都没有这套系统,只有零散的「待核」或文末说明。我做过三路排查:标注不在 SKILL.md 里(质检清单只有单个「暂缺」项),也不在我的研究指令里——它是模型在争议密度极高的对象上自发涌现的行为,而且只涌现过一次。

结论:模型的上限不缺(它做得出 90 分的严谨),缺的是下限稳定性。Skill 的价值恰好是把「偶尔做到」固化成「每次都做到」——这块目前是横纵分析法的空白。

二、一个单源翻车的实测案例

其中一份 FDE 报告(GLM 生成)把 OpenAI DeployCo 的成立日期写成了 2026-08-06,标注来源是「OpenAI 官方博客」。实际宣布日是 2026-05-11(第一财经 5 月 12 日报道等多个外部信源一致)。

事后排查病根:8 月那个日期是官网页面的 meta 时间戳(页面后来更新过)——一个真实存在的信源,模型也真的去查了,但因为只有单一信源、没有交叉验证,错得毫无察觉。讽刺的是,这份报告的强项恰恰是数据考古(抓出过 1165% 增速数据的出处错误归属、某流传人名查无此人),自己却在最重要的事件上翻车。

教训:「有可靠来源」不够,单一真实信源同样会翻车,关键事实需要双源交叉

三、建议方案(已在本地跑过一轮验证)

核心思路:标注规则上游化到子 Agent 采集层(信息进来时就带标签),三档归位:

  1. 已认定(默认态,正文不标注):能溯源到一手来源优先;否则找「互不转载」的两个独立信源交叉确认;都做不到 → 标【单一来源】,照用不丢弃(降级 ≠ 排除)
  2. 有分歧:记录「谁主张什么」,双方对称呈现,不代为裁决;未决司法一律「尚未认定」
  3. 暂缺:如实标注,不以推测填补

配套两条:

  • 标签在采集时打,不留到成稿后补——事后补标要么昂贵(要重新查证)要么形式化
  • 时效规则:现状类数据(格局/热度/融资/价格)优先引用近 12 个月来源,更早的只用于历史叙事
  • 防通胀:低争议对象标签稀疏是正常状态,不硬凑(「已认定」默认态天然解决了这点)

实测结果:用调整后的版本重跑 FDE,DeployCo 日期罗生门被完整裁决——宣布日 5-11 与官网 meta 时间戳 8-6 分开认定,病根写明;全文【单一来源】7 处、暂缺 4 处,无标签通胀。

四、顺带反馈:市场版分发损耗

ClawHub 上的 hv-analysis(@kkkkhazix)只有 78 行(GitHub 版 305 行),scripts 目录整个丢失——SKILL.md 里「使用自带的 scripts/md_to_pdf.py」那一步在市场版装上后必然失败。分发链 ClawHub → 腾讯 SkillHub → 各 Agent 市场层层同步,目前没有任何一层对完整性负责。如果你不知道这个情况,建议在 README 或 SKILL.md 末尾加一句「市场版为精简版,完整版以本仓库为准」,或在市场版里加个自检提示。


以上方案我已在本地验证过(调研与交叉验证部分由 AI 协作完成)。如果方向你觉得对,我可以整理成 PR 提过来。