#541·surya

如何重现 83.3% 的 olmOCR 评分? "我们输出 HTML 格式时所应用的调整"是什么?

作者: zhangxueren9创建于 2026年7月24日更新于 2026年7月24日
标签bug: output

□问.

README报告83.3%的olmOCR-bench为Surya OCR 2,"再生"部分说:

我们用 " vllm " (或 " LLaMA.cpp " )为模型服务,并从Alenai/olmocr运行 " olmOCR-bench " 控制带,** 并对输出的HTML格式作了一些调整。 **

我一直在努力复制这个 只能达到77.6分 将苏里亚的块-HTML输出转换为 olmOCR-bench 控制器所期望的。

** 请与大家分享(或描述)这些调整的具体内容。 ** 理想情况下,您用于基准的 HTML — text/markdown 转换代码 。

∮我的设定∮

  • surya-ocr ==0.22.1',型号datalab-to/surya-ocr-2',通过vLLM服务
  • 全页 OCR: " 识别前导(.)(图像,全页=真实) "
  • 我取每个区块的html' (reading order') 并转换为Markdown,用于运行标准的`olmocr-bench'计分器。

□我找到的(并固定在我身边)

从一个天真的HTML – Markdown转换开始,我得到了**58.6+. 有两个转换问题解释了大部分差距:

  1. ** Math 受电量影响而逃出。 ** 通用的HTML-Markdown步骤将QQmath > J 1 变为$J\ 1'. 绳子的数学比对失败了 保护`math'内容从**33.6%-83.1%确定。
  2. ** 包括跑动头/脚。 ** Surya忠实地发出 " Pageheader " / " PageFooter " 区块,但olmOCR-bench " 缺席 " 测试预计这些区块会被放弃。 从**27.5% 91.9% %中删除固定的页眉'/页眉'区块。

两项修正后:

QQ 类型 QQ 得分QQ |.

  • 总体情况*77.6(95%CI 76.5-78.7)
  • 基线 数学 数学 |表81.4|. 命令 命令 命令 命令 命令 命令 现为: 缺席

∮我仍然被困住∮

其余的~5-6点差距似乎集中在 " 现 " (56.2)和 " 顺序 " (72.7),主要是旧扫描/小文本页上。 我看不出官方是否运行:

  • 使用不同的HTML-文本正常化(例如,如何发射数学划界器、表格或块排序),
  • 放下/保留不同的区块标签,
  • 在特定的DPI制作页面,或
  • 套上绳子

** 是否有基准转换/调整脚本? ** 即使简略地描述HTML处理规则,社区也会复制83.3的数字. 谢谢!

内容来源: datalab-to/surya