NPL 最大匹配分词
NPL 最大匹配分词
实验报告
Ytinrete
课程:自然语言处理导论
题目:实现中文分词算法
1.实验目的
实现中文分词程序
2.方法介绍
从可行性(对我而言)的角度考虑,我只能实现基于字符串匹配的分词算法。具体为:
1. 从字典中将词全部存入内存当中。
2. 将词典的词一个一个跟待处理文件字节匹配,取最大的匹配长度并打印出空格。
3. 继续读入直到将待处理文件读完。
3.源程序
//假设字典文件处于相对目录文件名:dic.txt,其中的单词以每行一词存储 //源文件为:1998-01-qiefen-file.txt
//待处理文件处于相对目录文件名:target.txt(通过kill_space消除空行)
//生成文件处于相对目录文件名:complete.txt
kill_space.cpp
#include<iostream>
#include<fstream>
#include<map>
#include<string>
/*
Name: 删除空格
Description: 删除空格
*/


