从清晰可读的扫描件开始

在均匀光线下拍摄印刷文字,尽量完整裁切,并尽可能减少模糊。将扫描件旋转到易读的方向。阴影褶皱或反光可能会在 OCR 开始之前就遮住字母。如果源图像质量很差,重新拍摄通常比之后修复提取出的文本更有用。

运行文字识别

该应用已公开的功能包括用于从文档中提取文本的 OCR 和 TXT 导出。请针对你需要的扫描件使用文本提取流程。PDF 图像和提取出的文本是不同的输出:当文档的外观或版式很重要时,请保留原始扫描件。

在重复使用前校对

将提取出的文本与源文对照,尤其是姓名、日期、小数点和参考编号。OCR 可能会混淆相似的字母和数字,并且不一定能保留分栏或复杂表格。在将文本粘贴到其他文档之前先更正错误。切勿假定识别结果已经核实了原始内容。