数据挖掘旨在从大型数据集中发现规律。它运用统计学、机器学习和数据库技术来揭示那些不易察觉的关联。例如,零售商发现,购买尿布的顾客往往也会在周五晚上购买啤酒;银行发现某些交易模式可以预测欺诈行为;医院识别出导致患者再次入院的风险因素。这些规律是真实存在的,但它们是否有用,取决于你如何利用它们。
数据挖掘与数据分析并不相同。数据分析检验假设,而数据挖掘则生成假设。你并不知道要寻找什么。算法会发现相关性和异常值,然后由人来决定哪些相关性和异常值具有意义。最后一步至关重要。相关性并不等同于因果关系。某种模式可能是虚假的,可能反映了混淆变量,也可能是数据伪影。数据挖掘生成的是候选结果,而不是结论。相关技术包括聚类、分类、回归、关联规则和异常检测。每种技术都适用于不同的问题。这些工具已经变得易于使用。Python 库和云服务使得分析人员无需深厚的专业知识即可运行复杂的算法。风险在于误用。运行上千个模型并选择结果最佳的模型并非真正的发现,而是过拟合。模式必须在新数据上仍然成立才能被认为是真实的。
数据挖掘技术
- 聚类——将相似的记录分组
- 分类——将记录分配到相应类别
- 关联规则——查找同时出现的项目
- 回归分析——建立变量之间的关系模型
- 异常检测——识别异常记录
数据挖掘发现模式,而人类则决定这些模式的意义。算法只是一种工具,而非预言机。
Comments
No comments yet. Be the first to share a thought.
Leave a comment