3.3.3 数据采样

更新于 2026年10月10日 版权声明
3.3.3 数据采样

对于部分数据可视化项目,存在数据量过大,可视化存在困难的问题,对于这种问题,往往采用数据采样进行解决。数据采样就是按照某种规则从数据集中挑选样本数据。数据采样方法可分为三类。

(1)随机采样

随机采样是从被采样数据集中随机地抽取特定数量的数据,需要指定采样的个数。随机采样分为有放回采样和无放回采样。有放回采样可能会出现重复数据,无放回采样中采样数据不会出现重复的样本数据。

(2)系统采样

系统采样又称等距采样,就是将总体的采样数据集按某一顺序号分成n个部分,再从第一部分随机抽取第k号数据,依次用相等间距从每一部分中各抽取一个数据来组成样本。使用场景主要针对按一定关系排好的数据。(https://www.daowen.com)

系统样本对于样本的限定过大,往往针对不同层级的采样需要通过分层采样实现。

(3)分层采样

分层采样是先将采样数据集分成若干个类别,再从每一类别内随机抽取一定数量的数据,然后将这些数据组合在一起。分层采样主要被用于生成训练样本的场景中。因为在监督学习中,正负样本的比例是不可控的,当正负样本的比例过大或过小时,对于样本训练结果都是有影响的,所以通常需要分层采样来控制训练样本中的正负样本比例。

分层采样从每一个层级中随机地抽取出特定的数据,每个层级抽取的比例是可以自定义的。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)