全页 OCR 会将表格作为 <p> 标题来叙述,而不是转录它 – 每个图都会丢失 (surya-ocr-2)
作者: sgarchavada创建于 2026年8月19日更新于 2026年8月19日
页:1
用 " surya-ocr-2 " (Quen3.5-VL)全页模式,一个包含真实的页面
数据表有时以“表格”块的“html”/“text”作为返回
** 注释标题** (<p>.</pp>]),说明表 * 而不是 表 *
上面写着 当这种情况发生时,每个单元格值都消失——数字,
代码、数额——虽然请求仍然返回`200',但页数是正确的,
页面上还有大量其他文本。 没有错误,没有空页,以及
没有信号显示损失:沉默的数据损失。
我们屡次打这个 在被扫描的税单 /购买文件** 行项目表(项目代码、qty、单位税率、应纳税额、税额)。 我们已经 通过许多此类文件加以核实;它们是客户的机密记录。 我们无法附上原作,但行为一致 下面与我们看到的字节形状相匹配。
我们得到的和我们期待的
** 实际** - `表'块作为标题(缺值):
时间轴 :
有列的表:Sr No、项目代码、说明、Qty、UOM、单位率、 可评估价值、可评估价值总额、数额。 包括详情 ACME 混凝土混合器 65XL 和输出 IGST 四舍五入。
```** 预计** — 带有行数的实际表格(现有数值):
时间轴 : < 表格>
根由(只要我们能定位)
块路径正确读取同一张表格——只有整页路径 标题。 从`surya/承认/-init .py':
完整-页=真'-完整-页=-完整-页=- ' **1HGH-ACCURACY-BBO-X-PROMPT'每页** ("OCR此图像为HTML. 每个区块是一个分块...) ——表块是摘要.- 'full page=False'-每个区块 * BLOCK PROMPT`' ("OCR此区块图像为 HTML"). 表格全文。
所以说:
- 这不是** 检测失败(文本行被找到),
- 这不是** 引导-表路——我们用`SURYA GUIDED Table REC=False'运行。
这是 ** 全页解码 选择概括一个表** 而不是转录 它被密集/微小的扫描发票表所触发。
我们确认了两件事 可能有助于分解:
- 这是模型,不是硬码模板。 ** 标题措辞 (`'各栏的表格:<标题>。 包括 " row s样本 " 的细节。 ) 在Surya源头中, 故为"有期". 概述所学模型,每个表格的措辞不同;探测器必须按键 ** 结构*, 而不是任何固定字符串。
- ** 这是决定性的,不是抽样焦虑。 ** 重运行相同的全页 OCR 页面(temp 0)每次返回同为标题。
- 重写
- 使用任何**被扫描的税发票页,其主页 . . . . . . .
内容来源: datalab-to/surya