如何重现 83.3% 的 olmOCR 评分? "我们输出 HTML 格式时所应用的调整"是什么?
作者: zhangxueren9创建于 2026年7月24日更新于 2026年7月24日
标签bug: output
□问.
README报告83.3%的olmOCR-bench为Surya OCR 2,"再生"部分说:
我们用 " vllm " (或 " LLaMA.cpp " )为模型服务,并从Alenai/olmocr运行 " olmOCR-bench " 控制带,** 并对输出的HTML格式作了一些调整。 **
我一直在努力复制这个 只能达到77.6分 将苏里亚的块-HTML输出转换为 olmOCR-bench 控制器所期望的。
** 请与大家分享(或描述)这些调整的具体内容。 ** 理想情况下,您用于基准的 HTML — text/markdown 转换代码 。
∮我的设定∮
surya-ocr ==0.22.1',型号datalab-to/surya-ocr-2',通过vLLM服务- 全页 OCR: " 识别前导(.)(图像,全页=真实) "
- 我取每个区块的
html' (reading order') 并转换为Markdown,用于运行标准的`olmocr-bench'计分器。
□我找到的(并固定在我身边)
从一个天真的HTML – Markdown转换开始,我得到了**58.6+. 有两个转换问题解释了大部分差距:
- ** Math 受电量影响而逃出。 ** 通用的HTML-Markdown步骤将QQmath > J 1
变为$J\ 1'. 绳子的数学比对失败了 保护`math'内容从**33.6%-83.1%确定。 - ** 包括跑动头/脚。 ** Surya忠实地发出 " Pageheader " / " PageFooter " 区块,但olmOCR-bench " 缺席 " 测试预计这些区块会被放弃。 从**27.5% 91.9% %中删除固定的
页眉'/页眉'区块。
两项修正后:
QQ 类型 QQ 得分QQ |.
- 总体情况*77.6(95%CI 76.5-78.7)
- 基线 数学 数学 |表81.4|. 命令 命令 命令 命令 命令 命令 现为: 缺席
∮我仍然被困住∮
其余的~5-6点差距似乎集中在 " 现 " (56.2)和 " 顺序 " (72.7),主要是旧扫描/小文本页上。 我看不出官方是否运行:
- 使用不同的HTML-文本正常化(例如,如何发射数学划界器、表格或块排序),
- 放下/保留不同的区块标签,
- 在特定的DPI制作页面,或
- 套上绳子
** 是否有基准转换/调整脚本? ** 即使简略地描述HTML处理规则,社区也会复制83.3的数字. 谢谢!
内容来源: datalab-to/surya