数据仓库算法总结

数据仓库算法总结

事务处理环境不适宜DSS应用的原因: (1)事务处理和分析处理的性能特性不同 (2)数据集成问题 (3)历史数据问题 (4)数据的综合问题

数据仓库数据的四个基本特征: (1)数据仓库的数据是面向主题的 (2)数据仓库的数据是集成的 (3)数据仓库的数据是不可更新的 (4)数据仓库的数据是随时间不断变化

数据仓库定义:

数据仓库是在企业管理和决策中面向主题的、集成的、与时间相关的(时变的)、不可修改的(非易失的)数据集合,用于支持管理决策。

支持度

包含A和B的元组数若D中的事务包含A∪ )的百分比为s ,则称关联规则A—>B的支持度为

元组总数

s。即:support (A B)=P(A∪ B)

可信度/置信度

若D中包含A的事务同时也包含B的百分比为c ,则称关联规则A B的置信度/可信度为c。即: confidence(A B)=P(B|A) = support(A∪B)/support(A)

频繁项集

项集的出现频率是包含项集的事物数,简称项集的频率。 项集满足最小支持度阈值minsup:如果项集的出现频率大于或等于minsup与D中事物总数的乘积。

满足最小支持阈值的项集就称为频繁项集 (或大项集)。频繁k项集的集合记为Lk。

定理( Apriori性质)

频繁项集的所有非空子集都必须也是频繁的。 任何非频繁项集的超级一定也是非频繁的

Apriori算法

具体做法:对于所研究的事务数据库D,首先找出频繁1-项集的集合,记为L1 ;再用L1找频繁2-项集的集合L2 ;再用L2找L3 如此下去,直到不能找到频繁k-项集为止。找每个Lk需要一次数据库扫描。 如何实现用Lk-1找Lk. 连接步:

为找Lk,通过Lk-1与Lk-1连接产生候选k-项集的集合。该候选项集的集合记作Ck,执行

数据仓库算法总结相关文档

最新文档

返回顶部