6.3.5 进出口管理风险评估大数据平台的数据分析
大数据分析计算是大数据平台实现的关键环节之一,下面以红酒商品为例,详细介绍进出口管理风险评估大数据平台所使用的数据分析关键技术、算法模型以及风险评估分析过程。关于红酒风险评估的实现过程可通过扫描二维码查看。
1)数据分析关键技术
进出口管理风险评估大数据平台的数据分析关键技术主要体现在降维方法、数据聚类方法和风险评估方法三个方面。
(1)主成因分析法
主成因分析法(Principal Component Analysis,PCA)也称主分量分析,旨在利用降维的思想,把多指标转化为少数几个综合指标。
主成因分析法是一种降维的统计方法,借助于正交变换,将分量相关的原随机向量转化成分量不相关的新随机向量,这在代数上表现为将原随机向量的协方差阵变换成对角形阵,在几何上表现为将原坐标系变换成新的正交坐标系,使之指向样本点散布最开的p个正交方向,然后对多维变量系统进行降维处理,使之能以一个较高的精度转换成低维变量系统,再通过构造适当的价值函数,进一步把低维系统转化成一维系统。主成因分析经常用于减少数据集的维数,同时保持数据集的对方差贡献最大的特征。这是通过保留低阶主成因,忽略高阶主成因做到的。这样低阶成因往往能够保留住数据的最重要方面。
主成因分析的原理是设法将原来变量重新组合成一组新的相互无关的几个综合变量,同时根据实际需要从中可以取出几个综合变量尽可能多地反映原来变量的信息的统计方法称为主成因分析或称主分量分析,也是数学上处理降维的一种方法。
具体步骤如下:
•将原始数据按行排列组成矩阵X;
•对X进行数据标准化,使其均值变为零;
•求X的协方差矩阵C;
•将特征向量按特征值由大到小排列,取前k个按行组成矩阵P;
•用公式Vi=xi/(x1+x2+…)计算每个特征根的贡献率Vi;
根据特征根及其特征向量解释主成分物理意义。
(2)K⁃均值(K⁃means)算法
K⁃means算法是典型的基于距离的聚类算法,采用距离作为相似性的评价指标,即认为两个对象的距离越近,其相似度就越大。该算法认为簇是由距离靠近的对象组成的,因此把得到紧凑且独立的簇作为最终目标。
K⁃means算法先随机选取K个对象作为初始的聚类中心,然后计算每个对象与各种子聚类中心之间的距离,把每个对象分配给距离它最近的聚类中心。聚类中心及分配给它们的对象就代表一个聚类。一旦全部对象都被分配了,每个聚类的聚类中心会根据聚类中现有的对象被重新计算。这个过程将被迭代直到满足某个终止条件。
算法过程:
①从N个数据对象任意选择K个对象作为初始聚类中心。
②根据每个聚类对象的均值(中心对象),计算每个对象与这些中心对象的距离;并根据最小距离重新对相应对象进行划分。
③重新计算每个(有变化)聚类的均值(中心对象)。
④循环②到③直到每个聚类符合终止条件为止。
终止条件:
①没有(或最小数目)对象被重新分配给不同的聚类。
②没有(或最小数目)聚类中心再发生变化。
③误差平方和局部最小。
(3)决策树
决策树(Decision Tree)是在已知各种情况发生概率的基础上,通过构成决策树来求取净现值的期望值大于等于零的概率,评价项目风险,判断其可行性的决策分析方法,是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干,因此称决策树。决策树是一种树形结构,其中每个内部节点表示一个属性上的测试,每个分支代表一个测试输出,每个叶节点代表一种类别。
决策树法的关键步骤:
画出决策树。画决策树的过程也就是对未来可能发生的各种事件进行周密思考、预测的过程,并把这些情况用树状图表示出来。先画决策点,再找方案分枝和方案点,最后再画概率分枝。
推算概率值。由专家估计法或用试验数据推算出概率值,并把概率写在概率分枝的位置上。
计算益损期望值。从树梢开始,由右向左的顺序进行用期望值法计算。若决策目标是盈利时,比较各分枝,取期望值最大的分枝,其他分枝进行修剪。
决策树法可以进行多级决策。多级决策(序贯决策)的决策树有两个或以上决策点。
决策树的算法框架为:
决策树主函数。该函数的主要功能是按照某种预定规则生成决策树的各个分支,并根据终止条件结束算法。该函数主要完成如下功能:
功能1:输入需要分类的数据集和标签。
功能2:根据分类规则得到最优划分特征,并创建特征的划分节点,即计算最优特征子函数。
功能3:按照上述特征的值将数据集划分为若干部分,即划分数据集子函数。
功能4:根据划分数据集子函数的计算结果构建新的节点,生长新的分支。
功能5:检验是否符合递归的终止条件。
功能6:将划分的新节点包含的数据集和类别标签作为输入,递归执行上述步骤。
计算最优特征子函数。该函数用于计算最优特征。
划分数据集函数。该函数的主要功能为分隔数据集。
分类器。该函数通过遍历整个决策树,让测试数据找到决策树叶子节点对应的类别标签(即返回结果)。
2)数据分析算法模型(https://www.daowen.com)
以红酒类商品为例,对算法总体思路和算法模型进行介绍。
(1)总体思路
进出口管理对商品进行风险评估的总体流程分为:降维分析、聚类划分、决策树生成、决策树训练和风险评估,如图6⁃6所示。

图6⁃6 风险评估算法总体流程图
降维分析。从报关单的红酒类商品的商品规格字段(g_model)中,提取出红酒的商品规格描述,如品牌名称、年份、产区、等级、酒精度数、包装规格、葡萄比例等信息,用主成因分析法(PCA)对商品要素进行降维分析,得出影响红酒价格的主要三个因素为产区、年份、等级。
聚类划分。用K⁃means方法对红酒的申报价格进行价格区间的分类,得出不同的价格区间。
风险评估。用决策树来分析每个价格区间中产区、年份、等级这三个要素的主要特征,然后根据新的申报单中的产区、年份、等级来判断该项商品应该属于哪个价格区间,判断这项商品的申报单价是否在价格区间内。如果是,则该单申报价格无风险;若不是,则有风险。
(2)算法模型
主成因分析算法模型,如图6⁃7所示。

图6⁃7 主成因分析算法模型
K⁃means算法模型,如图6⁃8所示。



图6⁃8 K⁃means算法模型图
决策树算法模型,如图6⁃9所示。

图6⁃9 决策树算法模型图
在上述两步中,已经对红酒价格进行了主成因分析,降维和聚类划分得到价格区间,风险评估算法模型中用于生成决策树的特征为:产区、年份和等级,决策树的叶子节点为价格区间。
利用先验数据训练决策树后,就可对后续红酒报关数据进行风险评估。基于决策树的评估模式,如图6⁃10所示。
(3)红酒风险评估过程
图6⁃11为进出口管理风险评估大数据平台对红酒进行风险评估的总体流程。

图6⁃10 风险评估算法图

图6⁃11 红酒案例总体流程图
红酒风险评估的具体实现过程如下:
①从报关单表体(entry_list)中提取出201710(即2017.10月份,下同)的红酒(2204*)的数据;
②从商品规格(g_model)这个字段中,提取年份、等级、产区等信息,利用PCA方法分析得出,影响价格最大的三个要素为年份、等级、产区。
③计算出新的201710的申报单价;

至此,可以得到一个有申报单价、年份、等级、产区的新表,降维分析后的结果见表6⁃9。
表6⁃9 红酒数据降维分析后结果

④利用K⁃means对New_decl_price_10进行分类,得出10个价格区间。对每一条数据,做一个价格区间的标签,K⁃means分析后的结果见6⁃10。
表6⁃10 红酒案例K⁃means分析后结果

⑤利用决策树,分析维度为Year、Class、Region,分析对象为New_decl_price_10;正常情况下,得到图6⁃9的决策树模型。
⑥从报关单表体(entry_list)中提取出2017.11月份的红酒类(2204*)的数据。
⑦重复第⑤步和第⑥步。
第⑧步将第⑦步中得到的新的New_decl_price_201711带入第⑤步的决策树模型中,判断New_decl_price_201711是否在相对应的价格区间内,从而进行相应的风险等级判断。