将可视产品目录转换为结构化,可查询的数据在纸上听起来很简单: 将页面图像发送到一个OCR或Vision-Language Model(VLM).
将产品代码和价格摘录入JSON.
将行输入出产数据库.
我们与Mistral OCR, DeepSeek V4 Flash Vision Expect, 以及 Qune3-VL-32B-Instruct 的亲手基准证明了为什么这个精神模型在现实生活中崩溃.
困难的问题从来不是人格识别。
真正的瓶颈是关系保护:将正确的5位SKU与正确的变体联系起来,将竞选提议与列表价格区分开来,在没有人类干预的情况下解决多产品共享价格块.
这就是我们所学的为138页的PDF目录搭建提取管道, 为什么原始的OCR度量衡会误导, 以及我们如何构建一个防止商业事件的人机工作流程。
1.
输入限制:你不能扩大缺失信息的范围 我们的目录包括138个只印有图像的网页,每个网页都嵌入一个全页的JPEG,封顶在150 DPI.
我们的第一个建筑决定是直截了当的:使PDF在300+DPI上做是浪费计算.
提升低分辨率资产不会产生新的信号;它只是燃烧CPU循环并扩展了象征有效载荷.
相反,我们的管线直接取出生JPEG字节流,并将原始图像输入到模型端点.
真正的挑战在于布局模式:将垂直产品代码放在低相干摄影上。
运动价格和清单价格并列印刷。
适用于多种产品代码的共享价格块.
编辑页上零出品仍会引发假阳性.
如果一个管道将每个数字正确输入,但将竞选价格与错误的SKU对齐,它就产生了腐败的目录数据。
2.
基准:3个复杂布局模式 我们评价了同一目录固定装置的三个候选人:Mistral OCR(:文档布局和文本取出)。
DeepSeek V4 Flash Vision Exc:透過OpenRouter取景(实际0.00269美元).
Qune3-VL-32B-指令:通过OpenRouter进行结构化的视觉提取(实际0.00024美元/页).
所有请求都有确定性设置( ) 。
我们捕捉到原始载荷 耐久性 正常的JSON计划 和每页成本 基线测试:第94页(共同定价) 我们用一个棘手的基线测试了所有三个候选人:第94页,其中包含三个SKU(,,,,,,,,,,,,,,)共享一个单一的竞选价格()和名单价格(,).
型号 SKU Exact Match Property Price Exact Match 共享价格解析成本 / page Mistral OCR 0% (0/3) 100% (1/1) 0% (0/1) ~ 0.00350 (Est.) Qune3-VL-32B 0% (0/3) * 100% (1/1) 0% (0/1) 0.00024 (实际) DeepSeak V4 Flash 0% (0/3) 100% (1/1) 0% (0/1) 美元 (实际1/1) 0% (实际) * Quen3-VL上的注: 0%分数是评价员的化学错配导致的,而不是推论失败.
外卖:每个模特都抓住了竞选价格.
但隔离旋转的产品代码 并将其映射回共享的母价 整个自动运行失败。
DeepSeek对附近的数字产生了幻觉(,,,,,),而Mistral则将列表价格错误地归类为第二个竞选价格.
3.
评价员是测试中系统的一部分,我们最大的工程计划不是模型准确性,而是评估员的合同错误。
在人工核查期间,Qune3-VL成功地确定了产品代码和价格。
然而,我们的自动测试带 报告一个匹配率 因为计分员 期望一个JSON场 命名, 而Quen返回。
单键不匹配使得工作提取器在仪表盘上合成了0%的度量.
缩略语规则:在LLM/VLM评价管道中,解析器合同是生产代码: 在所有模型适配器上,在单条划线上标准化.
保存原始API有效载荷以调试评估器错误与模型幻觉.
分数实体关系(Price QQ SKU映射),不仅仅是原始的符号重叠.
4.
业务护卫:全面自动化后的援助 因为价格错误或SKU不匹配导致实际f