你好只用layout_detection的时候怎么获取相应的位置信息的json,目前只有一个 png图片输出。

Author: PublicVoid007Created Mar 24, 2025Updated Oct 10, 2025

你好: 我有两个问题:1.我想在只使用layout_detection的时候获取到类似ocr 识别结果的json,目的就是想获取layout_detection识别出来的各个方框区域的坐标。

  1. 现在的ocr 识别会单独识别每一行的内容,能不能一次性识别layout_detection检测的每一个矩形区域的内容。我的目的是为了做翻译。如果用现在的run_projrect.py的话,ocr 只能按行识别。导致去翻译的时候把同一句话分成两部分。请问怎么做。
  2. 我的翻译功能步骤是:1.layout_detection检测区域,记录坐标。 2.提取layout_detection检测的矩形区域内容。3.翻译每一个矩形区域的内容。4.生成新的 pdf,把翻译的内容写到原来矩形对应的区域。

Source: opendatalab/PDF-Extract-Kit