你好,当只使用 layout_detection 时,如何获取相应的位置信息的 json,目前只有一个 png 图片输出。
作者: PublicVoid007创建于 2025年3月24日更新于 2025年10月10日
Hello: I have two questions: 1. 我想在只使用layout_detection时获取类似ocr识别结果的json,目的是想获取layout_detection识别出来的各个方框区域的坐标。 2. 现在的ocr识别会单独识别每一行的内容,能不能一次性识别layout_detection检测的每一个矩形区域的内容。我的目的是为了做翻译。如果使用现在的run_projrect.py,ocr只能按行识别。导致翻译时把同一句话分成两部分。请问怎么做。 3. 我的翻译功能步骤是: 1.layout_detection检测区域,记录坐标。 2.提取layout_detection检测的矩形区域内容。 3.翻译每一个矩形区域的内容。 4.生成新的pdf,把翻译的内容写到原来矩形对应的区域。
内容来源: opendatalab/PDF-Extract-Kit