#173·anydoc

在转换为 PDF 过程中,多列表格会变成无法阅读的单列数据块

作者: stevehome创建于 2026年9月12日更新于 2026年9月12日

□ 总结 当一个 PDF 页面包含多列布局(例如每个单元格的表格有分组的弹出列表)时,Anydoc的 Markdown 表格重建会将列倒塌为被套装的单个blob,失去行/栏结构和可分性.

□ 重现

npx -y @firecrawl/anydoc "欧盟AI-Act-overview-30-May-2024.pdf" -o out.md.

来源:PDF:https://artificialintelligenceact.eu/high-level-summary/(也见于未来生命.org)

□被观察 出处页面包含一个"附件三使用案例"的表格,有~9个类别行(非被禁生物鉴别技术,关键基础设施,教育,就业,公/私服务,执法,移民,司法),每行列出几个出处.

anydoc的输出将所有这一切合并为一小撮结构不齐全的Markdown表格行,并带有空的正前方单元格,一行一行一行的弹出文字没有行间断,一行一行一行地流出glyph文物(如:QQflfififififififififififiçá),而不只是本表.

□ 预期行为 要么:

  1. 以正确的行/栏边界重构表格,或
  2. 回到将单元格内容作为读取顺序文本/列表(如平版pdftotext风格的提取在同一PDF上确实成功)释放,而不是产生一个比平版文本不易读取的破损表.

□ 环境

  • @ firecrawl/ anydoc 版本:0.2.4
  • 调用: CLI, 无 -- ocr 旗 (本地 PDF 文本提取路径- 与 --ocr 托管结果相同)
  • 操作系统: macOS

内容来源: firecrawl/anydoc