report audit.py 提取:基于regex的提取从叙事表单元格中产生虚假的阳性"数据点"

作者: allenhangliu-design创建于 2026年7月19日更新于 2026年7月19日

□ 总结

工具/报告-审计.py提要'将Markdown表格取出(标签、价值、单位)'三分,以构建15%的审计样本。 取出regex没有字段界限或上下文意识,因此它也抓取了嵌入在表细胞内普通道具/识别符中的数字,产生实际上无法核实的外部诉求的审计样本项目.

□ 重现

报告表格如下:

减记

|. ^ FY2026E 非 GAAP EPS 指导 ^ 1.85– 2.25 → 公司指导 (2026年两次提出) → — — — — —


减记
战略 建议
|-|-|-.
如果你已经持有 \ ... 如果你还没有独立检查 RPO 差距相对于 10K, 这是唯一的最高值验证 下一步。 |

在包含这些样本的报告上进行“摘录”,例如:

* 资料来源:2026.00。
建议10.00
  • ID 12来源于"出自2026"一栏"两次"所取"2026"的字面词——根本不是一个数据点.
  • ID 34来自自由文本推荐单元格中"10-K"中的"10"(一个备案名称).

亦非应入取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取

□ 根源(就我所知,来自 parse md tables /extract data points')

    • is valid label' / 列首跳出列表(SKIP' set;col header.upper ()' in (.)extract data points'中的检查)仅包含**中**名词(来源,说明,备注等). 英文报告标题如Source'、Notes'和Verifed'没有过滤,因此整个叙述栏都扫描数字。
  1. 编号Regex([\d,\.]+])没有要求该匹配是一个独立的数字——它与数字数字相匹配,数字数字是字母符号的一部分,如10-K'、4'、`COVID-19'等。

□ 建议修正

  • 扩大标题跳出列表,以包括共同的英文对应语:来源'、来源'、注'、核实'、建议'、评注'、`摘要'。
  • 要求匹配的号码出现在字母不紧接的字段边界上(例如,拒绝像10-K'那样的匹配,数字紧接后是-'+字母,形成已知的识别图案,或更简单:跳过“数字”紧接无空格字母的单元格,因为这几乎总是标识/引用,而不是独立值)。
  • 任选:让报告从提取中选择一个特定的一栏(例如,将标题与较宽的停止列表相匹配的任何一栏,或像一个字面上题为“Assumption”/“Model Intvolution”的一栏那样的减记公约,作为非事实/不可核查的一栏,因为这些往往是自我计算的情况产出,而不是外部来源的索赔)。

如果维护者能确认哪个固定方向优先使用, 乐于提交 PR 列表 —— 页眉- skip- list . . . . . . .

内容来源: xbtlin/ai-berkshire