数据仓库算法总结
数据仓库算法总结
事务处理环境不适宜DSS应用的原因: (1)事务处理和分析处理的性能特性不同 (2)数据集成问题 (3)历史数据问题 (4)数据的综合问题
数据仓库数据的四个基本特征: (1)数据仓库的数据是面向主题的 (2)数据仓库的数据是集成的 (3)数据仓库的数据是不可更新的 (4)数据仓库的数据是随时间不断变化
数据仓库定义:
数据仓库是在企业管理和决策中面向主题的、集成的、与时间相关的(时变的)、不可修改的(非易失的)数据集合,用于支持管理决策。
支持度
包含A和B的元组数若D中的事务包含A∪ )的百分比为s ,则称关联规则A—>B的支持度为
元组总数
s。即:support (A B)=P(A∪ B)
可信度/置信度
若D中包含A的事务同时也包含B的百分比为c ,则称关联规则A B的置信度/可信度为c。即: confidence(A B)=P(B|A) = support(A∪B)/support(A)
频繁项集
项集的出现频率是包含项集的事物数,简称项集的频率。 项集满足最小支持度阈值minsup:如果项集的出现频率大于或等于minsup与D中事物总数的乘积。
满足最小支持阈值的项集就称为频繁项集 (或大项集)。频繁k项集的集合记为Lk。
定理( Apriori性质)
频繁项集的所有非空子集都必须也是频繁的。 任何非频繁项集的超级一定也是非频繁的
Apriori算法
具体做法:对于所研究的事务数据库D,首先找出频繁1-项集的集合,记为L1 ;再用L1找频繁2-项集的集合L2 ;再用L2找L3 如此下去,直到不能找到频繁k-项集为止。找每个Lk需要一次数据库扫描。 如何实现用Lk-1找Lk. 连接步:
为找Lk,通过Lk-1与Lk-1连接产生候选k-项集的集合。该候选项集的集合记作Ck,执行


