改进/讨论: 通过 arafix 进行阿拉伯语语言解析的基准和支持
作者: bio-colab创建于 2026年8月3日更新于 2026年8月3日
嗨,@baidu团队,
首先,祝贺发布无限制-OCR! 长视距文件分析能力和与SGLang/vLLM的整合看来很有希望。
我是**arafix**的维护者,这是一个开放源码的Python工具,专门用于阿拉伯文文本恢复、版式诊断和评价本地PDF和复杂的文件流。
鉴于阿拉伯文文档解析的独特挑战(从右到左的排版、复杂的通绳、字母连接规则以及本地PDF中的编码/流问题),我愿意探讨** 无限制-OCR**如何处理阿拉伯文文本取出,并表示支持测试/标出阿拉伯文的性能。
- 潜在合作领域/测试:
- 阿拉伯OCR和剖析基准: 在复杂的阿拉伯语布局上评价无限-OCR,多栏文章,以及带有阿拉伯语/英语混合文本的文件.
- ** 后处理和质量核查:** 利用`afix'来验证结构的忠实性、字符连接性以及提取输出的文本取向性。
- 数据集/案件共享: 提供具有代表性的阿拉伯本土PDF样本和边缘案例,以帮助提高阿拉伯语模式稳健性。
我很乐意使用无限制OCR对阿拉伯文件数据集进行一些基准测试,并在此分享详细的评价结果,如果小组有兴趣的话。
期待你们的想法!
谢谢 以利亚·沙拉尔
内容来源: baidu/Unlimited-OCR