用OCR软件进行扫描识别文本的技巧

互联网 | 编辑: 2007-12-17 00:30:00转载

扫描仪的一个重要功能就是通过OCR软件（即文字识别软件）将扫描后的文字图像转换成文本格式的文件，使文字处理软件能够调用处理。这样可以大大提高文字录入速度，极大地提高工作效率。目前，文字识别软件主要有《尚书OCR》、《汉王OCR》和《紫光OCR》等几种。

不过，我们在进行文字识别时经常会遇到识别率低的问题，其原因除了被识别稿件有问题外，主要还是我们没有掌握好扫描及OCR识别软件的使用技巧。那么进行文字识别时有哪些技巧呢？

一、根据识别稿的质量进行处理

进行扫描识别时，在可能的情况下应尽量选择清晰度与洁净度都很高的识别稿，识别稿的清晰度与洁净度的不同会使扫描后的识别率有很大差距。对一般的印刷稿、打印稿等质量较好的文稿进行识别，只要掌握好方法与技巧，其识别率一般可达到98％以上。而对报纸、杂志等清晰度不佳的原稿进行识别，无论使用何种识别软件都难以达到很高的识别率。

1.对一些带有下划线、分隔线等符号的文本原稿，有些OCR软件是识别不出的，一般会出现乱码。如果必须扫描带有这些符号的原稿，一是要确保使用的识别软件能够识别这些符号。二是使用工具擦掉这些特殊符号，使识别软件能正确识别这些文字。

如果扫描后的文档中含有OCR软件不能识别的图像、图形和一些特殊符号，可以考虑使用“擦拭”工具将文档中的图像、图形和一些特殊符号擦除，同时将图像上一些杂点也一并去除。使图像中除了文字没有多余的东西，这可以大大提高识别率并减少识别后的修改工作。

2.在扫描识别报纸或纸张较薄的文稿时，扫描时稿件背面的文字通常会透过纸张造成错字或乱码，使识别率大大降低。在对这类原稿扫描时，我们可以在原稿的背面覆盖一张黑纸，在进行正式扫描时，适当增加扫描对比度或亮度，即可有效提高识别率。

3.对于一些图文混排的原稿，扫描成一幅图像进行全区识别会严重影响OCR软件的识别率。我们可以根据实际情况将扫描后的版面切分成多个区域后再识别，切分区域的原则是：将图形、图像排除在区域之外（图1），尽量把文字字体、字号一致的划在一个区域内，不要嫌这个过程烦琐而选用自动切分区域，手动选取扫描区域会有更好识别效果，还应注意各识别区域不能有交叉情况。

图1 版面切分

二、扫描识别稿的操作技巧

1.首先要保持工作环境的清洁，扫描仪的玻璃板以及若干个反光镜片及镜头，其中任何一部分脏污都会影响扫描文字图像的效果。因此，保持扫描仪的清洁是确保文字图像扫描质量及识别率较高的重要前提。

2.扫描仪在刚开启时，光源的稳定性较差，而且光源的色温也没有达到正常工作所需的色温，所以开始扫描以前最好先让扫描仪预热一段时间。

3.在放置扫描原稿时，把扫描的文字材料摆放在扫描起始线正中，可以最大限度地避免由于光学透镜导致的失真而影响识别率。

4.扫描后的文字图像经常会有一定角度的倾斜，出现这种情况必须在扫描后使用自动或手动旋转工具进行纠正，OCR软件一般都设有自动纠偏和手动纠偏工具。否则OCR识别软件会将水平笔画当作斜笔画处理，识别率会下降很多。如果扫描后的文字图像倾斜角度超过15°，倾斜校正会产生较大的失真和误差，从而严重影响识别率，这种情况建议摆正原稿重新扫描。

三、扫描参数的设置

扫描参数的设置主要包括分辨率的设置及亮度和对比度的设置。

1.一般来讲，分辨率越高识别率也就会越高。但这也不是绝对的，对于一些过大过粗的字体，设置过高的分辨率，识别率可能会降低，而且设置高分辨率后，扫描速度会大大降低。根据实际经验，1、2、3号字的文稿推荐使用200dpi，4、小4、5号字的文稿推荐使用300dpi，小5、6号字的文稿推荐使用400dpi，7、8号字的文稿推荐使用600dpi（图2）。

图2 选择分辨率

2.扫描时适当地调整好亮度和对比度值，对识别率的高低影响很大，在进行扫描亮度和对比度的设定时（图3），以扫描后的图像中文字的笔画较细、均匀，且没有明显断点为准。如果扫描后的文字图像存在黑点、黑斑或文字线条很粗很黑，分不清笔画，说明亮度值太小，应该增加亮度值再重新扫描。如果文字线条凹凸不平，有断线甚至图像中汉字轮廓严重残缺时，说明亮度值太大，应减小亮度后再重新扫描。如果要扫描质量比较差的文稿，比如报纸，扫描出的图像可能会出现大量的黑点，而且在字体的笔画上也会出现粘连现象，为获得较好的识别结果，必须仔细进行亮度和对比度值的调整，反复扫描多次才能获得比较理想的效果。

图3 扫描亮度和对比度的设定

四、识别后的处理工作

1.文字校正

文字校正是OCR识别工作中比较烦琐的一步。一般OCR软件对可能出现错误的文字，会显示出蓝色标记，请用户确认。但在没有提示出错的地方，也有可能出错。所以大家在校对时应该通读一遍，以提高文字录入的准确率。

2.识别后文本的保存

如果把识别后的文本简单复制粘贴到Word中保存处理，就需要去掉多余的硬回车，这样会非常麻烦。正确方法是：先将识别后的文本存盘，在存盘时设置为软回车就行了。对于《紫光OCR》，则需要在识别完成后，选择文件菜单下的导出命令，将存储类型选为TXT，段内回车字符选为无。注意：一定不要直接存盘，否则不能自动去掉文章的硬回车。《尚书OCR》、《汉王OCR》和《紫光OCR》都提供了段内去除硬回车的功能。

每日精选

万级大电池开始普及 OPPO首款破万电池手机来了

OPPO即将推出的OPPO A7 Pro Max，将搭载10000mAh单电芯超大电池，这也是OPPO品牌旗下首款电池容量突破万级的智能手机，该机还配备80W超级闪充，兼顾超大电池与高效补电速度。

标签： OPPO| OPPOA7ProMax| 电池| 2026-07-21
小米18系列或取消Ultra版本标准版诚意十足

据外媒消息称，小米18系列迎来重大产品策略调整，将取消Ultra影像旗舰，仅推出小米18、小米18 Pro、小米18 Pro Max三款机型。

标签：小米| 小米18| Ultra| 2026-07-21
欧盟对阿里AliExpress开出5.5亿欧元罚单 DSA实施以来最高

欧盟委员会宣布，对阿里巴巴旗下跨境电商平台速卖通（AliExpress）处以5.5亿欧元罚款，认定其违反《数字服务法案》（DSA）关于评估和降低非法商品传播系统性风险的相关义务。

标签：阿里| AliExpress| 罚单| DSA| 2026-07-21
AI分级国标测试结果公布 11款手机获L3级认证

在2026世界人工智能大会上，《人工智能终端智能化分级》国家标准实施后的首批测试结果正式公布。华为、moto、荣耀、vivo、OPPO、小米与STEPX Neo等品牌的9款手机，荣获L3辅助级认证。

标签： L3| 国标| AI| 2026-07-21
AI分级国标产品测试成果公布 9款电视斩获L3级

2026世界人工智能大会现场发布《人工智能终端智能化分级》国家标准落地后的首轮产品测试成果，其中电视品类共计9款产品成功取得L3级认证，包括华为、索尼、TCL、海信等头部品牌。

标签：电视| 华为| 海信| TCL| 索尼| 2026-07-21
小米平板9入网信息曝光 9720mAh电池、标配45W快充头

爆料信息称，小米平板9定位常规大尺寸平板，搭载骁龙8系旗舰处理器；续航迎来明显升级，电池容量提升至9720mAh。

标签：小米平板| 小米| 平板| 小米平板9| 2026-07-21
暑假换机首选！990g机身45W性能，华硕a豆14 Air 2026闭眼入

如果你的预算在6K-7K左右的话，那么今年暑假值得重点关注的一款产品，就是华硕a豆14 Air 2026高性能AI超轻薄旗舰本。

标签：华硕| a豆14Air| 换机| 导购| 2026-07-21
刷新行业速度长城H10预售12小时斩获2.2万订单

长城H10开启预售12小时内订单即突破22615台。这款21.48万起的“方盒子大六座”SUV，凭借精准的市场定位、硬核的智能与动力配置以及“一个长城”的品牌背书，成功点燃了中国大家庭的出行热情，成为年度爆款。

标签：长城| H10| 预售| 2026-07-22
双重成本压力来袭 iPhone 18系列涨价成定局

iPhone 18 系列涨价已成定局，全系机型售价将迎来上调，高端版本涨幅尤为明显。

标签：苹果| iPhone18| 涨价| 2026-07-22
机构看好苹果折叠屏预测市场份额超越华为

市场调研机构预测，随着iPhone Fold正式登场，全球折叠屏市场竞争格局将彻底改写，形成三星、苹果、华为三足鼎立的全新态势。

标签：苹果| 华为| 折叠屏| 2026-07-22