5.1.2 大数据与机器学习

更新于 2026年10月10日 版权声明
5.1.2 大数据与机器学习

大数据,指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,需要新的处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

大数据的核心是利用数据的价值,机器学习是使数据产生价值的关键技术。一般来讲,人们很难从原始数据本身获得有价值的信息,例如,垃圾邮件检测,单纯检测邮件中是否包含某个单词并没有太大意义,往往需要检测当某几个特定单词同时出现时,再辅以考察邮件长度以及其他因素,从而判断该邮件是否为垃圾邮件。也就是说,机器学习能够把看起来杂乱无序的数据转换成有用的信息。对于大数据而言,机器学习是不可或缺的;相反,对于机器学习而言,越多的数据会越可能提升模型的精确性,从而获得更精准的信息,可以说,机器学习的兴盛离不开大数据的帮助。大数据与机器学习两者是互相促进,相依相存的关系。

机器学习是利用数据,训练出模型,然后使用模型进行预测的一种方法。尽管机器学习的一些结果具有很大的魔力,在某种场合下是大数据价值最好的说明,但这并不代表机器学习是大数据下的唯一的分析方法。大数据中包含有分布式计算、内存数据库、多维分析等多种技术,机器学习仅仅是大数据分析中的一种而已。机器学习可以看作是人们做大数据分析的一个比较好用的工具,但是大数据分析的工具并不只机器学习,机器学习也并不只能做大数据分析。

机器学习过程中,首先需要在计算机中存储历史的数据,然后将这些数据通过机器学习算法进行处理,这个过程在机器学习中叫“训练”,最后处理的结果可以被用来对新的数据进行预测,这个结果一般称之为“模型”。对新数据的预测过程在机器学习中叫“预测”。“训练”与“预测”是机器学习的两个过程,“模型”则是过程的中间输出结果,“训练”产生“模型”,“模型”指导“预测”。

人类在成长、生活过程中积累了很多的历史与经验。人类定期地对这些经验进行“归纳”,获得了生活的“规律”。当人类遇到未知的问题或者需要对未来进行“推测”的时候,人类使用这些“规律”,对未知问题与未来进行“推测”,从而指导自己的生活和工作。

机器学习中的“训练”与“预测”过程可以对应到人类的“归纳”和“推测”过程。通过这样的对应,可以发现,机器学习的思想并不复杂,仅仅是对人类在生活中学习成长的一个模拟。由于机器学习不是基于编程形成的结果,因此它的处理过程不是因果的逻辑,而是通过归纳思想得出的相关性结论。

机器学习的任务,就是要在基于大数据量的基础上,发掘其中蕴含并且有用的信息。其处理的数据越多,机器学习就越能体现出优势,以前很多用机器学习解决不了或处理不好的问题,可以通过提供更多的数据得到解决或提升其性能,如语言识别、图像识别、天气预测等。机器学习的工作方式可以归结如下:(https://www.daowen.com)

•选择数据:将数据分成训练数据、验证数据和测试数据三组。

•构建模型:使用训练数据来构建具有相关特征的模型。

•验证模型:使用验证数据接入模型。

•测试模型:使用测试数据检查被验证的模型的表现。

•使用模型:使用完全训练好的模型在新数据上做预测。

•优化模型:使用更多数据、不同的特征或调整过的参数来提升模型的性能表现。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)