电商数据挖掘之关联算法（一）_大数据_计算头条_中国计算网——工业互联网一站式服务平台—

就“啤酒＋尿布”这个案例而言，使用关联规则挖掘技术，对交易资料库中的记录进行资料挖掘，首先必须要设定最小支持度与最小可信度两个门槛值，在此假设最小支持度min-support=5% 且最小可信度min-confidence=65%。因此符合需求的关联规则将必须同时满足以上两个条件。若经过挖掘所找到的关联规则 {尿布，啤酒}满足下列条件，将可接受{尿布，啤酒} 的关联规则。用公式可以描述为：

Support（尿布，啤酒）≥5% and Confidence（尿布，啤酒）≥65%。

其中，Support（尿布，啤酒）≥5%于此应用范例中的意义为：在所有的交易记录资料中，至少有5%的交易呈现尿布与啤酒这两项商品被同时购买的交易行为。Confidence（尿布，啤酒）≥65%于此应用范例中的意义为：在所有包含尿布的交易记录资料中，至少有65%的交易会同时购买啤酒。

因此，今后若有某消费者出现购买尿布的行为，我们将可推荐该消费者同时购买啤酒。这个商品推荐的行为则是根据{尿布，啤酒}关联规则而定，因为就过去的交易记录而言，支持了“大部分购买尿布的交易，会同时购买啤酒”的消费行为。

从上面的介绍还可以看出，关联规则挖掘通常比较适用于记录中的指标取离散值的情况。

如果原始数据库中的指标值是取连续的数据，则在关联规则挖掘之前应该进行适当的数据离散化（实际上就是将某个区间的值对应于某个值），数据的离散化是数据挖掘前的重要环节，离散化的过程是否合理将直接影响关联规则的挖掘结果。

文/通策信息首席运营官谭磊来源：i天下网商

2/2 首页上一页 1 2