在转换为 PDF 过程中,多列表格会变成无法阅读的单列数据块
作者: stevehome创建于 2026年9月12日更新于 2026年9月12日
□ 总结 当一个 PDF 页面包含多列布局(例如每个单元格的表格有分组的弹出列表)时,Anydoc的 Markdown 表格重建会将列倒塌为被套装的单个blob,失去行/栏结构和可分性.
□ 重现
npx -y @firecrawl/anydoc "欧盟AI-Act-overview-30-May-2024.pdf" -o out.md.
来源:PDF:https://artificialintelligenceact.eu/high-level-summary/(也见于未来生命.org)
□被观察 出处页面包含一个"附件三使用案例"的表格,有~9个类别行(非被禁生物鉴别技术,关键基础设施,教育,就业,公/私服务,执法,移民,司法),每行列出几个出处.
anydoc的输出将所有这一切合并为一小撮结构不齐全的Markdown表格行,并带有空的正前方单元格,一行一行一行的弹出文字没有行间断,一行一行一行地流出glyph文物(如:QQflfififififififififififiçá),而不只是本表.
□ 预期行为 要么:
- 以正确的行/栏边界重构表格,或
- 回到将单元格内容作为读取顺序文本/列表(如平版pdftotext风格的提取在同一PDF上确实成功)释放,而不是产生一个比平版文本不易读取的破损表.
□ 环境
- @ firecrawl/ anydoc 版本:0.2.4
- 调用: CLI, 无 -- ocr 旗 (本地 PDF 文本提取路径- 与 --ocr 托管结果相同)
- 操作系统: macOS
内容来源: firecrawl/anydoc