1.5.1 DANA Studio
DANA Studio是上海德拓信息技术股份有限公司在其原先的DANA大数据基础平台上研发的面向开发者、数据管理者、数据应用者提供的一站式大数据协作开发、管理平台,致力于解决结构化、半结构化和非结构化数据的采集融合、数据治理、计算分析、数据挖掘等问题。其中多样化的开发组件适应不同场景,搭配高度自由的DAG工作流和强大的作业调度、运维面板,让DANA Studio成为助力大数据项目的快速实施、交付的利器。
DANA Studio基于B/S架构,底层是DANA大数据基础平台,如图1⁃9所示。DANA Studio包括了六大核心模块,分别是工作流、数据集成、数据开发、数据中心、数据探索、运维中心。

图1⁃9 DANA Studio核心模块
图1⁃10为DANA Studio的底层架构。该架构支持机器学习MLlib、流计算、SQL分析、图计算等大数据计算分析模式和Zeppelin数据探索技术。
DANA Studio数据探索模块主要负责对数据的挖掘功能,目前主要提供两大模块:交互式分析和模型构建。(https://www.daowen.com)

图1⁃10 DANA Studio底层架构图
交互式分析主要是在全局上对数据进行观察,得到数据的统计性指标,提供工具有Elasticsearch、Shell、 JDBC、HBase、 Hive、Spark、R、Python、Markdown,需要用户自行配置环境即可使用相应工具进行操作。
模型构建主要是在数据基础上结合相关算法构建模型,此模块提供两种实验类型:Example和Blankml。Example提供10个学习案例,用户可以选择从提供的案例中学习构建模型的一般流程,但不能直接在项目中使用,仅作学习用途;Blankml是新建一个空白实验,供用户自行构建模型,此操作需有PySpark的代码编写基础。
DANA Studio具有强大的底层技术栈。DANA Studio数据采集技术基于Datax、Kettle、Logstash构建,适应离线、实时等多种数据采集需要。DANA Studio数据存储技术基于海量数据持续增长下的大型数据仓库Hadoop构建,支持MPP分析型数据库,提供高性能SQL分析。支持NoSQL检索引擎,满足结构化、非结构化数据的毫秒级精确查询与分析,DANA Studio数据分析技术基于实时分布式计算引擎,可以实现面向流数据的分布式内存计算,为低延时和高吞吐场景而生,可以轻松解决传统Hadoop计算慢的问题。DANA Studio数据挖掘引擎基于SparkML构建,内置丰富的算法库与行业应用模块,可实现高效数据挖掘应用。DANA Studio通过集成强大的调度工具来配合各个模块,形成有向无环DAG工作流调度作业。