NPL 最大匹配分词

NPL 最大匹配分词

实验报告

Ytinrete

课程:自然语言处理导论

题目:实现中文分词算法

1.实验目的

实现中文分词程序

2.方法介绍

从可行性(对我而言)的角度考虑,我只能实现基于字符串匹配的分词算法。具体为:

1. 从字典中将词全部存入内存当中。

2. 将词典的词一个一个跟待处理文件字节匹配,取最大的匹配长度并打印出空格。

3. 继续读入直到将待处理文件读完。

3.源程序

//假设字典文件处于相对目录文件名:dic.txt,其中的单词以每行一词存储 //源文件为:1998-01-qiefen-file.txt

//待处理文件处于相对目录文件名:target.txt(通过kill_space消除空行)

//生成文件处于相对目录文件名:complete.txt

kill_space.cpp

#include<iostream>

#include<fstream>

#include<map>

#include<string>

/*

Name: 删除空格

Description: 删除空格

*/

NPL 最大匹配分词相关文档

最新文档

返回顶部