基于PCA变换和k近邻法印刷体数字图像识别
基于PCA变换和k近邻法的印刷体数字图像识别
摘要:随着当今社会的日新月异及信息化进程的快速发展,我们如今正被数字化时代笼罩着,数字正朝着庖代我们对话语和文字的语言表达、记忆的方向进展。本文通过pca变换和k近邻法对数字图像识别进行研究,比较了bayes方法、最近邻法和k-近邻法的识别效率,最后通过pca变换和k-近邻法的印刷体识别算法的系统设计实验,解释了k-近邻法的识别优势。
关键词:pca变换;k近邻法;数字识别
中图分类号:tp391
1pca的基本思想
pca是采取一种数学降维的方法,找出几个综合变量来代替原来众多的变量,使这些综合变量能尽可能地代表原来变量的信息量,而且彼此之间互不相关。这种将把多个变量化为少数几个互相无关的综合变量的统计分析方法就叫做主成分分析或主分量分析。
pca所要做的就是设法将原来众多具有一定相关性的变量,重新组合为一组新的相互无关的综合变量来代替原来变量。通常,数学上的处理方法就是将原来的变量做线性组合,作为新的综合变量,但是这种组合如果不加以限制,则可以有很多,应该如何选择呢?如果将选取的第一个线性组合即第一个综合变量记为f1,自然希望它尽可能多地反映原来变量的信息,这里“信息”用方差来测量,即希望var(f1)越大,表示f1包含的信息越多。因此在所有的线性组合中所选取的f1应该是方差最大的,故称f1为第一主成分。如


