6.3.4 进出口管理风险评估大数据平台的数据存储

更新于 2026年10月10日 版权声明
6.3.4 进出口管理风险评估大数据平台的数据存储

根据数据来源,进出口管理风险评估数据在数据量、数据类型、数据空间分布、数据维度以及数据相关性上呈现如下特点。

数据量庞大。进出口管理风险评估大数据平台的数据量庞大主要源于两个方面:一是数据源种类多,包括商品数据、外贸口岸数据、外贸监管数据企业数据、物流数据、电子账册数据以及通关数据等数据;另一个是数据量大,每一批次的通关商品都对应一套完整的通关数据,这些通关数据的量不会因为商品数量少而减少种类,反之会因为商品数量的增加使得商品对应数据成倍增加。

数据类型混合复杂。进出口管理风险评估数据包含了结构化数据、半结构化数据和非结构化数据。其中,结构化数据主要包括报关单、舱单、电子账册等外贸通关数据;半结构化数据主要包括商品价格电商数据、商品原产地网络收集数据等数据;非结构化数据主要包括各类单据图片凭证数据、外贸监控数据、外贸物流物联监控数据等数据。

数据多集中于外贸口岸。由于进出口管理风险评估大数据平台的应用对象为进出口商品,因而其所采集包含的数据主要来自外贸通关口岸。外贸通关口岸的空间分布性决定了数据的空间分布性。

数据多维度。维度,又称为维数,是数学上独立参数的数目。数据维度,是指数据所具备的维数。显然,在进出口管理风险评估大数据平台所拥有的数据集合里,数据是多维的,数据维度是较高的。不同的实体数据,具备不同的数据维度。例如,商品数据包含了商品原产地、商品价格、商品生产时间等不同的维度数据。企业数据包含了企业法人、 企业编号、企业申报商品等不同的维度数据。由于进出口管理风险评估大数据平台的数据库包含了多类实体的数据,而每一类实体又具备多个维度的数据,因此使进出口管理风险评估大数据平台中的数据呈现多维度性。

数据相关性不一致。数据相关性是指数据之间存在的某种关系,这种关系可强可弱,甚至不相关。数据相关性不一致,是指各维度数据之间的相关性有差异,并非统一程度的。由于进出口管理风险评估大数据平台中的数据多实体性,使得同一实体所含不同维度数据之间具备较强的相关性,而不同实体间的不同维度数据具备较弱的相关性,甚至不同实体、不同维度的数据是不相关的。例如,商品所包含的商品原产地数据和商品价格数据具备较强的相关性,外贸企业所包含的企业所在地数据和企业商品通关口岸之间存在较强的相关性,而外贸企业所在地数据和商品原产地数据之间的相关性则很弱,几乎不相关。

结合上述数据特点,进出口管理风险评估大数据平台在数据存储方式上采取依据数据类型进行分类存储的方式,如图6⁃3所示。

图示

图6⁃3 分类存储方式示意图

图示

图6⁃4 数据存储总体流程图

图6⁃4为进出口管理风险评估大数据平台数据存储的总体流程。其中,数据存储并非简单地将获取到的数据入库即可,而是在数据存储入库后对数据进行必要的预处理,为后续的数据分析应用进行准备。数据预处理,主要为数据清洗。通过数据清洗,获得后续数据分析所需要的基础数据,包括获得进出口管理风险评估大数据平台实现功能需求的数据。

进出口管理风险评估大数据平台数据同时兼具了结构化数据、半结构化数据和非结构化数据。按照数据分类存储的方式,与数据类型对应的存储技术依次为结构化数据存储技术、半结构化数据存储技术和非结构化数据存储技术。结合大数据开发平台DANA 4.0构成和基于DANA 4.0的大数据平台开发流程,进出口管理风险评估大数据平台在存储技术和工具选取见表6⁃8。

表6⁃8 数据存储技术与工具表

图示

数据存储之前,结合进出口管理业务需求在不同口岸或岗位部署对应大数据平台,使之便于各类数据的收集。然后,通过已部署大数据平台或大数据采集工具,实现网络信息数据、外贸通关数据和外贸监管数据的采集。对采集到的数据进行预处理,主要为数据的清洗。图6⁃5所示为数据清洗后的效果。接下来,就是数据的存储入库。该步骤将已经预处理的数据,根据数据类型及时存入对应数据库。

图示

图6⁃5 数据清洗结果例图

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)