基于数据仓库和作业的高效改进Apriori算法

数据挖掘需要有“纯净”的数据和良好的数据组织,数据的质量直接影响到数据挖掘的效果,数据仓库从各类数据源中抽取数据,经过清洗、集成、选择、转换处理,为数据挖掘所需要的高质量数据提供了保证。本文提出以数据仓库为数据源,采用作业定时预先生成简化的频繁2.项集,应用存储过程执行效率高的特点,在压缩数据库大小的同时也压缩频繁i项集的大小,实现高效改进Apriori算法

维普资讯 www.wendangwang.com

第2 5卷第 2期 20 0 8年 6月

河北省科学院学报 J u n lo e He e Ac d my o ce c s o r a ft b i a e S in e h f

V 12 o 2 o .5 N .

J n 0 8 u e2 0

文章编号:0 1— 3 3 2 0 ) 2— 0 0— 5 10 9 8 ( 0 8 0 0 1 0

基于数据仓库和作业的高效改进 Apir算法 r i o 褚蓓蓓,邸书灵,鹏郭 (. 1石家庄铁道学院计算机与信息工程分院,河北石家庄 0 04;. 50 3 2石家庄学院图书馆,河北石家庄 0 03 ) 50 5

要:数据挖掘需要有“纯净”的数据和良好的数据组织,数据的质量直接影响到数据挖掘的效果,据仓数

库从各类数据源中抽取数据,经过清洗、集成、选择、转换处理,为数据挖掘所需要的高质量数据提供了保证。 本文提出以数据仓库为数据源,用作业定时预先生成简化的频繁 2项集,用存储过程执行效率高的特采 -应

点,缩数据库大小的同时也压缩频繁 i在压项集的大小,高效改进 A rr算法。实现 po ii 关键词: pir算法;数据仓库;D S包;作业;存储过程;最小支持度 Ari o T 中图分类号:P3 16 T 0 .文献标识码: A

E ce t r v dAp ir ag rtm ae n d t a e o s n o i f inl i o e ro i lo i y mp h b sdo aaw rh u ea dj b GHU B i e e— i,DI u l g,GUO n b Sh—n i Pe g (. o p t n f r t nE gnei p r n,S ̄ zu n ala stt,h ah agt bi 50 3 C ia 1 C m ue adI omai n i r gDeat t h m h agR i yI tueS i zu n ee r n o e n me w ni i f l 00 4, hn; 2 Lbay S iaha g【 . irr,h izun, j n,hizu n bi 5 05, hn ) S ̄ah agHee i 0 0 3 C ia

Ab tac: t n n e d o ha e p r a a a d g o aa o g n z to t e q lt fd t ie ty a e t s r t Daa mi i g n e s t v u e d t n o

d d t r a iai n,h uai o aa d r cl f cs y t f ci e e s o aa mi n a d da r h u e e ta t t r m a iusd t o r e by ce ni g,n e he e e t n s fd t nig n t wa e o s xr csdaa fo v ro a a s u c s, l a n i t— v a ,

g ai n, h ie a d ta so ma i n, n r v d s ag a a t e frd t nig. s d o e d t r h u e t i r to c oc n r n fr to a d p o i e u r n e o a a mi n Ba e n t aa wa e o s h s h ,

p p ri rv sef in yt eA ro lo tm, rt, ytew yo o e eaigtefe u n -e,i n a e mpo e fce t p ir ag r h f sl b h a f b g n rt q e t s tt i l h i i i y J n h r 2 mig, a d a p ia in o he c a a t rsis i l me tto f ce t ft e so e r c d r c mp e sn h a a n p lc t ft h r ce tc mp e n ai n ef i n l o h tr d p o e u e o r s i g t e d t— o i i y ,

b s n r q e tis t a e a d fe u n -e .

Ke wo d: r r;D t rh u e;D S;J b;Soe rc d r;Mii m u p ̄ y r s Ap ii o aawae o s T o trdp o e u e nmu s p o

O引言 A rw l 19 ga a于 93年提出的 A r r算法是所 pii o有关联规则挖掘算法的核心,pi算法的基本 A rr o i思想是将关联规则挖掘算法的设计步骤分为两步:

Y=,,,,。,… 2‘∈,那么只包含集合 2,,{,,一厶}中项的规则最多有条,,,,,… 2,,2 …

+,,一 I, .… i1

。在这些规则中,

只有那些可信度大于用户给定的最小可信度的规则才被保留下来。 A rr算法为了生成所有频繁项集,用了 p oi i使

i找到所有支持度大于最小支持度的项 ) 集,即频繁项集; i) i使用

第一步找到的频繁项集产生所期望 的规则。

递归方法,首先产生频繁 1一项集的集合 L, 1然后是 2项集的工,一 2直到某个 r值使得 L为空,时 r这 算法停止,算法的伪代码可以表示为以下:该 ( ) 1= f df qet1imst D) 1L i—r un一 t e (; n e e s

第二步相对简单,如果给定了一个频繁项集

收稿日期:0 7~ 9—1 20 0 0

基金项目:天津市科技发展计划资助项目( 4 19 1 03 0 4 R)

作者简介:褚蓓蓓 (9 8一,, 17 )女河北人,硕士,,助教主要从事数据库技术及应用研究

www.wendangwang.com

你可能喜欢

  • apriori算法
  • 十大数据挖掘算法
  • Apriori算法的应用
  • kmeans聚类算法
  • 数据挖掘聚类算法
  • 数据挖掘论文
  • 关联规则挖掘
  • 关联规则分析

基于数据仓库和作业的高效改进Apriori算法相关文档

最新文档

返回顶部