#551·surya

全页 OCR 会将表格作为 <p> 标题来叙述,而不是转录它 – 每个图都会丢失 (surya-ocr-2)

作者: sgarchavada创建于 2026年8月19日更新于 2026年8月19日

页:1

用 " surya-ocr-2 " (Quen3.5-VL)全页模式,一个包含真实的页面 数据表有时以“表格”块的“html”/“text”作为返回 ** 注释标题** (<p>.</pp>]),说明表 * 而不是 表 * 上面写着 当这种情况发生时,每个单元格值都消失——数字, 代码、数额——虽然请求仍然返回`200',但页数是正确的, 页面上还有大量其他文本。 没有错误,没有空页,以及 没有信号显示损失:沉默的数据损失

我们屡次打这个 在被扫描的税单 /购买文件** 行项目表(项目代码、qty、单位税率、应纳税额、税额)。 我们已经 通过许多此类文件加以核实;它们是客户的机密记录。 我们无法附上原作,但行为一致 下面与我们看到的字节形状相匹配。

我们得到的和我们期待的

** 实际** - `表'块作为标题(缺值):

时间轴 :

有列的表:Sr No、项目代码、说明、Qty、UOM、单位率、 可评估价值、可评估价值总额、数额。 包括详情 ACME 混凝土混合器 65XL 和输出 IGST 四舍五入。

```

** 预计** — 带有行数的实际表格(现有数值):

时间轴 : < 表格>

1 2132903010 ACME混凝土混合器65XL 1 EA 500000.00 500000.00 500000.00 . . . . . . . . 发票金额 590000.00 < /表 > ```

根由(只要我们能定位)

块路径正确读取同一张表格——只有整页路径 标题。 从`surya/承认/-init .py':

  • 完整-页=真'-完整-页=-完整-页=- ' **1HGH-ACCURACY-BBO-X-PROMPT'每页** ("OCR此图像为HTML. 每个区块是一个分块...) ——表块是摘要.
  • 'full page=False'-每个区块 * BLOCK PROMPT`' ("OCR此区块图像为 HTML"). 表格全文

所以说:

  • 这不是** 检测失败(文本行被找到),
  • 这不是** 引导-表路——我们用`SURYA GUIDED Table REC=False'运行。

这是 ** 全页解码 选择概括一个表** 而不是转录 它被密集/微小的扫描发票表所触发。

我们确认了两件事 可能有助于分解:

  1. 这是模型,不是硬码模板。 ** 标题措辞 (`'各栏的表格:<标题>。 包括 " row s样本 " 的细节。 ) 在Surya源头中, 故为"有期". 概述所学模型,每个表格的措辞不同;探测器必须按键 ** 结构*, 而不是任何固定字符串。
  2. ** 这是决定性的,不是抽样焦虑。 ** 重运行相同的全页 OCR 页面(temp 0)每次返回同为标题。
  • 重写
  1. 使用任何**被扫描的税发票页,其主页 . . . . . . .

内容来源: datalab-to/surya