浅谈互联网信息挖掘技术

文章编号:1671-8496(2003)04-0037-03

浅谈互联网信息挖掘技术

黄君羡 欧 薇

(广东交通职业技术学院,广东广州,510650)

摘要: 本文就互联网信息挖掘技术和对网络信息挖掘中的关键技术、系统流程进行了阐述。

关键词: 数据挖掘 互联网 网页 信息提取

中图分类号:G354.4 文献标识码:A

1 概述

随着互联网的快速发展,浩如烟海的各种信息呈现在用户面前。但伴随的问题是用户越来越难以获得其最需要的信息。早期为了解决此问题,出现了以雅虎(Yahoo)为代表的半自动化的网络搜索引擎(Search Engine)。网络搜索引擎主要由网络机器人(Robot)、索引数据库和查询服务三个部分组成。网络机器人对互联网资源进行遍历,尽可能多地发现并采集新的信息;采用全文检索技术对采集到的信息建立索引存到索引数据库中,能够极大地提高信息检索的速度;查询服务接收并分析用户的查询,即将用户查询作为数据库提问式,根据一定的匹配策略,如布尔模型、模糊布尔模型等方法遍历索引数据库,最后将达到一定的匹配程度的结果(包括标题项,简单文摘和链接地址)集合返回给用户。由于人工智能研究还未达到实用化水平,目前网络机器人还无法实现信息的准确分类,使得检索的结果不尽人意,例如,某一用户利用“加密解密”进行检索时,其本意是想得到有关加密解密发展情况的资料,但搜索引擎大多是返回大量的无关其关键技术发展的文章,造成这样情况的原因是现有的搜索引擎大多是基于简单的关键词匹配,不能真正理解用户的检索意图所造成的。另外,目前多数搜索站点都是通过人工方式对信息进行再一次处理,这样使得信息整理的速度远远落后于网络信息的膨胀。

为了实现个性化的主动信息服务,网络信息挖掘(Web Mining)技术成为近年来的一个新的研究课题,它是数据挖掘技术在网络信息处理中的应用。网络信息挖掘是指在大量训练样本的基础上,得到数据对象间的内在特征,并以此为依据进行有目的的信息提取。例如,当信息挖掘系统发现用户的兴趣是“加密解密技术发展”时,它就会自动过滤掉加密解密技术等无关的数据,这样可以大大减少用户的检索时间和成本。

网络信息挖掘与网络信息检索所采用的技术有很多相似之处,但也有本质的区别。网络信息挖掘技术沿用了Robot、全文检索等网络信息检索中的优秀成果,同时综合运用人工智能、模式识别、神经网络领域的各种技术。网络信息挖掘系统与网络信息检索的最大不同在于它能够获取用户个性化的信息需求,根据目标特征信息在网络上,或者信息库中进行有目的的信息搜寻。本文现就网络信息挖掘技术的总体流程、技术实现进行阐述。

2 网络信息挖掘技术中的关键技术及系统流程

2.1 网络信息挖掘中的关键技术

2.1.1 目标样本的特征提取

网络信息挖掘系统采用向量空间模型(Vector Space Modal,VSM),用特征词条(T1,T2,…,Tn)及其权值Wi代表目标信息。在进行信息匹配时,使用这些特征项评价未知文本与目标样本的相关程度。特征词条及其权值的选取称为目标样本的特征提取,特征提取算法的优劣将直接影响到系统的运行效果。词条在不同内容的文档中所呈现出的频率分布是不同的,因此,可以根据词条的频率特性进行特征提取和权重评价。

一个有效的特征项集应该既能体现目标内容,也能将目标同其它文档相区分,因此,词条权重的正比于词条的文档内频数,反比于训练文本内出现该词条的文档频数。构造如下特征项权值评价函数:

Weight(word)= tfik*IDFi= tfik*log(N/nk+1)

其中tfik表示词条Tk在文档Di中的出现频数;IDFi为逆文档频数;N表示全部目标样本的文档数;nk表示出现词条Tk的文档数。若考虑词长因素,可进行标准化处理得:

Weight(word)=tfik*log(N/nk+1)/∑(tf

k=1nik)*log(N/nk+1) 22

收稿日期:2003-01-06

作者简介:黄君羡(1978.10-),男,助讲讲师 录用日期:2003-10-3 研究方向:网络

37

你可能喜欢

  • 十大数据挖掘算法
  • 网络信息
  • 决策支持系统应用
  • 互联网金融
  • 机器学习与知识发现
  • 网络模型
  • 智能决策支持系统

浅谈互联网信息挖掘技术相关文档

最新文档

返回顶部