输出流中的重复字符
作者: woodjohndavid创建于 2019年10月31日更新于 2026年7月5日
标签accuracydiplopia
请参阅以下链接: https://GitHub.com/tesseract-ocr/tesseract/pull/2635 这涉及到对 lstm_choices_mode 所做的更改。 除非我误解了这些选项的作用,否则似乎存在一个错误或疏漏。 请参阅此用户区域主题: https://groups.google.com/forum/#!topic/tesseract-ocr/5tC6appoUgE 似乎没有办法阻止 lstm 在生成的文本和/或 HOCR 输出中包含重复的字符。 上面的主题中的示例正是如此。 当然,一定有一种方法可以强制 Tesseract 仅包含字符的最高置信度级别的选择,如果有多种可能性。 另外,如果此内容发布在错误的地方,请接受可能的重复发布。 我是一个 Tesseract 新手,正在尝试学习这些知识。 谢谢。
内容来源: tesseract-ocr/tesseract