大数据驱动电商智能分析
大数据驱动的商业智能在电子商务数据分析中的应用
1. 引言
商业智能(BI)的概念由高德纳咨询公司提出,涉及信息的搜索、管理和分析,旨在使决策者能够获取知识并做出更有效的决策。商业智能并非一种独立的技术,而是一整套解决方案。它将数据仓库、联机分析处理、数据挖掘和可视化技术集成到商业活动中,将复杂的信息转化为辅助性知识,最终将知识呈现给用户,以支持企业决策。
随着互联网应用规模的持续扩大,需要处理的数据量呈指数级增长,数据结构也日趋复杂,企业运营压力急剧增加,这直接推动了大数据处理技术[1]的发展。随着电子商务、云计算和移动社交媒体等新一代信息技术的快速发展,传统的BI系统已无法满足企业数据分析的需求。个性化、数据化和科学化的数据分析技术逐渐使得传统BI系统需要与大数据技术相结合,以实现新的平台架构,满足大数据分析的需求。
2. 基于传统BI系统的大数据应用设计
在大数据时代,传统BI的数据存储能力、数据分析能力和实时数据处理能力难以胜任非结构化复杂数据源的应用与分析。因此,如何充分利用现有的BI和大数据技术,成为新平台架构设计的关键。传统BI的数据主要来源于内部操作系统和管理系统;而大数据的主要来源是互联网,如微博、网页等数据交换。二者在数据源、数据采集、数据处理、数据存储以及未来的数据应用方面存在本质差异[2]。基于上述考虑,设计了如图1所示的新架构平台。
数据源主要包括企业的内部数据和外部数据。内部数据由OA系统、ERP系统、财务报表系统及其他相关的结构化数据组成。外部数据包括互联网上的非结构化数据,如超文本、图像和视频。数据采集在原有数据收集方式的基础上,增加了互联网网络爬虫这一新的采集方式。针对结构化数据和非结构化数据采用不同的处理方法。非结构化数据被整理为结构化数据后存储于分布式结构化数据库中;传统数据仍存储在关系型数据库中。大数据主要以分布式文件系统(HDFS)和NoSQL数据库的形式进行存储。最终的数据主要用于在线分析处理、数据挖掘、数据可视化等。
3. 数据采集方法
大数据背景下的数据收集方法主要包括三类:系统日志收集、网络数据收集和数据接口收集。
日志数据采集通过设备中的日志子系统实现,可在需要时生成日志消息。常见的商业数据 API支持通过REST API获取数据信息。网络爬虫技术主要用于网络数据采集,其核心原理是利用HTTP协议模拟浏览器,通过统一资源定位符URL地址访问Web服务器,获取Web服务器的权限,返回原始页面并解析数据 [3]。
传统爬虫技术可能存在一些问题,因此应运而生了旨在爬取网络资源的聚焦爬虫技术。聚焦爬虫根据既定的爬取目标(以电子商务销售主题为例),有选择地访问互联网上的网络相关链接,获取所需信息。聚焦爬虫不追求对网页的全面覆盖,而是针对特定主题相关的网页,为面向主题的用户查询准备数据资源。
4. 企业电子商务数据应用案例
4.1. K‐均值算法
K‐均值是一种广泛使用的聚类方法,可将D个实体划分为N个簇。这确保了簇内的相似性尽可能高,而簇间的相似性尽可能低。K‐均值算法的过程如下:
- 随机选择N个数据点作为质心;
- 计算数据集中每个数据点到质心的距离,并将数据集中的所有数据点聚合到N个簇中;
- 根据步骤2中计算出的N组数据点,迭代计算新的质心;
- 重复步骤2‐3,直到最终质心与前一个质心之间的距离很小(满足收敛条件);
- 最后,读取所有观测值,并根据距离最近的质心类别对每个观测值进行分类,分类结束。
质心和距离是K‐均值算法的两个基本概念。质心可以被视为一个样本,或数据集中某个数据点 A,它被定义为一组具有相似性数据的中心。质心的选择对聚类结果有很大影响,因为该算法会随机选择任意对象作为初始聚类的质心,并初步代表聚类结果。当然,这一结果通常不合理,仅仅是随机划分的数据集。为了逼近期望的聚类结果,需要通过多次迭代来具体修正质心:将具有相似性的对象分到同一组中,这些组都具有相同的质心。此外,由于初始质心选择具有随机性,最终结果不一定符合预期,因此需要进行多次迭代,在每次迭代中重新随机选择初始质心,直到最终聚类结果满足预期 [4]。
距离实际上是相似性的一种度量。常见的距离公式包括曼哈顿距离、欧几里得距离、闵可夫斯基距离、切比雪夫距离等。在聚类分析中,最常用的距离公式是欧几里得距离,因为欧几里得距离直观且易于计算,并且在对象点的坐标平移和旋转变化中,欧几里得距离的值保持不变,因此仍能根据对象原有的相似性来判断对象的相似程度。如果D(x, y)表示对象a与对象b之间的距离,则d(x, y)应满足以下三个属性:
- 非负性:即 d(x, y) 为常数;当且仅当 x = y 时,d(x, y) = 0。
- 对称性:d(x, y) = d(y, x)。
- 三角不等式:对任意对象 a、b、c,有 d(x, y) + d(y, z) ≥ d(x, z)
4.2. 电子商务数据在企业中的应用分析
在大数据时代,独立的数据本身价值有限。通过数据预测未来趋势、通过数据发现隐藏知识才是关键。许多中药煎剂企业紧跟时代发展,在电子商务网站上设有相应的中药煎剂销售店铺,因此积累了大量客户购买中药煎剂的消费记录。对这些消费记录进行分析,可将消费者划分为不同群体,并根据不同群体的消费行为实施个性化营销。客户分类有助于针对不同客户群提供差异化服务,同时使企业能够及时察觉市场和客户的一些细微变化,并据此调整策略。
RFM模型是一种广泛使用的多因素客户分类方法,R(最近一次消费)表示客户最近一次交易到当前时间的时间段。F(消费频率)表示客户在指定时间段内与企业合作的次数(即购买行为)。M(消费金额)表示客户与企业在指定时间段内交易所产生的金额。RFM通过客户创造的绝对金额来衡量客户价值 [5]。
现在我们从某中药饮片电商网站爬取相关数据,根据一定的数据处理原则对原始数据进行清洗和整理,得到处理后的消费者数据(3000条)。其中,R表示最近一次购买中药饮片的时间间隔,F表示购买中药饮片的频率,M表示在某一平台的总消费金额。部分有效数据截取如表1所示。
| 客户序列号 | R | F | M |
|---|---|---|---|
| 1 | 27 | 6 | 334.21 |
| 2 | 3 | 5 | 759.19 |
| 3 | 4 | 16 | 1383.39 |
| 4 | 3 | 11 | 3280.77 |
| 5 | 14 | 7 | 154.65 |
| 6 | 19 | 6 | 501.38 |
| 7 | 5 | 2 | 1721.93 |
| 8 | 26 | 2 | 107.18 |
| 9 | 21 | 9 | 973.36 |
| 10 | 2 | 21 | 764.55 |
| 11 | 15 | 2 | 1251.4 |
| 12 | 26 | 3 | 923.28 |
| 13 | 17 | 11 | 1011.18 |
| 14 | 30 | 16 | 1847.61 |
| 15 | 5 | 7 | 1669.46 |
不同数据项在数值大小和单位上存在差异,因此不能直接用于参与计算。例如,消费者购买商品M的总金额是一个数值较大的属性,单位通常超过100;而在某一时间段内购买商品的频率则数值较小,相对于消费金额影响较弱。为了使这些属性能够有效发挥作用,需要将其属性值与其对应的取值范围进行比较,以消除单位和数值之间的差异,从而使这些标准化后的数据能够在后续阶段直接用于计算。本文采用归一化处理方法对数据进行处理。下表2为3000条经过处理的数据的一部分。
| 客户序列号 | R | F | M |
|---|---|---|---|
| 1 | 0.000889182 | 0.000329254 | 0.000168387 |
| 2 | 9.8798E‐05 | 0.000274379 | 0.000382507 |
| 3 | 0.000131731 | 0.000878011 | 0.000697002 |
| 4 | 9.8798E‐05 | 0.000603633 | 0.001652971 |
| 5 | 0.000461057 | 0.00038413 | 7.79183E‐O5 |
| 6 | 0.00062572 | 0.000329254 | 0.000252613 |
| 7 | 0.000164663 | 0.000109751 | 0.000867571 |
| 8 | 0.000856249 | 0.000109751 | 5.40012E‐05 |
| 9 | 0.000691586 | 0.000493881 | 0.000490414 |
| 10 | 6.58653E‐05 | 0.00115239 | 0.000385208 |
| 11 | 0.00049399 | 0.000109751 | 0.000630501 |
| 12 | 0.000856249 | 0.000164627 | 0.000465182 |
| 13 | 0.000559855 | 0.000603633 | 0.000509469 |
| 14 | 0.00098798 | 0.000878011 | 0.000930893 |
| 15 | 0.000164663 | 0.00038413 | 0.000841134 |
使用K‐均值算法,将簇的数量设为3,最大迭代次数为3,距离函数采用欧几里得距离。由于初始质心是随机的,每次聚类的结果可能有所不同。经过重复实验,检测聚类结果基本一致,因此可以利用该聚类结果分析簇用户的簇特征,并开展群体个性化营销。以下是K‐均值算法聚类生成的组一、组二和组三的示意图,如图2中的消费者群体所示。
5. 结论
在大数据背景下,充分利用数据挖掘信息可以抓住市场机会。除了线下销售外,许多企业还利用独特优势开展在线交易,从海量电子商务数据中挖掘隐藏的信息,并根据这些信息针对不同客户群体进行个性化营销,从而提升客户满意度和经济效益。本文主要研究大数据与传统商业智能在电子商务企业数据分析中的应用,重点探讨聚类分析中的K‐Means算法及其在电子商务网站客户消费数据挖掘中的应用。聚类分析将客户划分为三个群体,根据不同客户群体的特征,帮助企业识别客户,从而实现差异化营销目标。
更多推荐



所有评论(0)