php实现验证码识别-中级篇
逸学堂 2009-03-10 11:14:47 这篇文章是
http://topic.csdn.net/u/20090303/15/0bec0070-e387-4611-aac8-721df3207b33.html
的继续。
php识别验证码初级篇,只提供了针对特定位置,特定字体的数字验证码识别技术。本篇文章尝试识别旋转字体,字符粘连的数字和字母的验证码,同时还进一步增强了去杂点功能,增加了bmp转jpeg的功能,还增加了学习功能(需要手工支持)。
在上篇文章<php实现验证码的识别(初级篇)>中,讲了如何识别简单的验证,这里的简单只的是验证码有数字和字母组成,格式统一,每次出现位置固定。这篇文章将继续深入研究识别验证码,这次识别的目标是,验证码有字符和数字组成,验证码存在旋转(可能左右都旋转),位置不固定,存在字符与字符之间的粘连,且验证码有更强的干扰素。这篇文章讲解的方法,并不是万能的解决方案,并且提供代码不能直接解决你的问题,这里仅仅是方法,具体需求读者自己解决,需要说明的是,识别验证码与具体的编程语言无关,这里只是使用php语言实现,使用这里介绍的方法,你可以使用任何语言实现。
这篇文章逐步讲解识别验证码过程中的各个步骤。
如上图,随后的讲解我们都围绕此图展开。
一:拿到一个验证码的,第一眼我们首先要做的工作是,二值化。把验证码的部分用1表示,背景部分用0表示出来,识别方法很简单,我们打印出验证码正张图片的RGB,然后分析其规律即可,通过RGB码,我们很容易分辨出上面这张图片的R值大于120,G和B的值小于80,所以依据这个规则我们很容易把上面的图片二值化。再看初级篇中识别的两张图
刚看上去,感觉很复杂。验证码的图片每次背景色都不相同,且不是单色,各个验证码数字的颜色每次也各不相同。貌似很难二值化,其实我们打印出其RGB值很容易就发现。无论验证数字颜色如何变化,该数字的RGB值总有一个值小于125,所以通过如下判断
原文URL: http://blog.csdn.net/ugg/archive/2009/03/09/3972368.aspx
代码下载:http://download.csdn.net/source/1084418
欢迎拍砖