报错截图、英文说明书要拷出来。中文证件和手写请不要用这一页,识别率会对着你撒谎。中文头词被证件和身份证占满,产品只有 eng。
英文报错截图要贴进工单——英文为主的 OCR。中文头词被证件和身份证占满,产品只有 eng,标题必须写清。PaddleOCR、证件套件是另一类产品,我们不抢。
有文字层的 PDF 走提取文本。只要图片走相册工具。两版识别结果对比走 Diff。
英文界面,不是证件
eng为主。竖排中文、印章、身份证不追。- 能复制的 PDF 先提取文本。大约 32 MB。
- 不是证件。不是中文主力。
- 首次下载模型是预期;图仍留在标签页。公司策略若拦模型文件,识别会起不来。
怎么用
- 放入清晰的英文印刷体或界面截图。先转正、裁掉无关边。
- 识别。校对专有名词、数字、报错码。
- 中文合同、证件离开本页。
使用前先看清的限制
不是证件。不是中文主力。大约 32 MB。手写和章会差。识别结果要人工校对。