正向最大匹配分词算法的分析与改进

正向最大匹配分词算法的分析与改进

正向最大匹配分词算法的分析与改进

摘要: 本文主要通过对影响正向最大匹配算法效率的因素的分

析,提出对该算法的一点改进,以及设计了相应的词典结构,以期

在匹配过程中尽可能的减少比较次数,提高分词效率。

关键词: 中文分词;最大匹配算法;词典机制

中图分类号tp39 文献标识码a 文章编号 1674-6708(2011)

53-0164-02

0引言

在自然语言处理中,“词是最小的能够独立活动的有意义的语言成

分”[1],而汉语和英语等其它西文比起来,有着自身的特点。英语、

法语等欧美语言在书写时就以词为基本构成单位,以空格作为分词

的依据;而汉语在书写时是一大串汉字的字符串,从形式上根本没

有词的概念。中文分词指的就是将一个汉字序列切分成一个一个单

独的具有实际意义的词,它是中文信息处理的基础。中文自动分词

的现有的分词算法可分为三大类:基于字符串匹配的分词方法、基

于理解的分词方法和基于统计的分词方法[2]。

在基于字符串匹配的分词算法中,词典的设计往往对分词算法的

效率有很大的影响。本文通过对影响正向最大匹配算法效率因素的

分析,设计一种带词长信息的分词词典,同时在该词典基础上,对

正向最大匹配算法做出一些改进,以提高分词的效率。

1正向最大匹配分词算法介绍和分析

你可能喜欢

  • Linux操作系统
  • Linux系统命令使用详解
  • Excel使用技巧大全(超
  • 算法设计与分析
  • 算法分析与设计期末
  • 中文分词算法

正向最大匹配分词算法的分析与改进相关文档

最新文档

返回顶部