什么是数据挖掘？

作者: yoku酱 | 来源:发表于2019-11-06 11:57 被阅读0次

数据挖掘学习笔记（一）
什么是数据挖掘？
什么是数据挖掘？
什么是数据挖掘？
[WEKA] 1 概览
第 1 章绪论
数据挖掘导论
数据挖掘
数据挖掘入门小知识
数据仓库快速入门教程17数据挖掘

大数据时代已经来临，利用网络和生活中产生的大量数据发现问题并创造价值，使得数据挖掘成了一门新的学科和技术。那么什么是大数据挖掘，数据挖掘的过程是什么，以及它的具体算法又有哪些?今天带你一起了解数据挖掘到底是什么？

1、首先，数据挖掘到底是什么?

官方的定义，数据挖掘(DataMining)就是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

通俗易懂的说，数据挖掘就是从大量的数据中，发现那些我们想要的“东西”。

2、这个“东西”具体指什么?

一种被称为预测任务。

也就是说给了一定的目标属性，让去预测目标的另外一特定属性。如果该属性是离散的，通常称之为‘分类’，而如果目标属性是一个连续的值，则称之为‘回归’。

另一种被称为描述任务。如果你对大数据开发感兴趣，想系统学习大数据的话，可以加入大数据技术学习交流扣扣群：458数字345数字782，欢迎添加，私信管理员，了解课程介绍，获取学习资源

这是指找出数据间潜在的联系模式。比方说两个数据存在强关联的关系，像大数据分析发现的一个特点：买尿布的男性通常也会买点啤酒，那么商家根据这个可以将这两种商品打包出售来提高业绩。另外一个非常重要的就是聚类分析，这也是在日常数据挖掘中应用非常非常频繁的一种分析，旨在发现紧密相关的观测值组群，可以在没有标签的情况下将所有的数据分为合适的几类来进行分析或者降维。

其他的描述任务还有异常检测，其过程类似于聚类的反过程，聚类将相似的数据聚合在一起，而异常检测将离群太远的点给剔除出来。

3、数据挖掘的一般过程包括以下几个方面：

数据预处理

数据挖掘

后处理

首先来说说数据预处理。之所以有这样一个步骤，是因为通常的数据挖掘需要涉及相对较大的数据量，这些数据可能来源不一导致格式不同，可能有的数据还存在一些缺失值或者无效值，如果不经处理直接将这些‘脏’数据放到模型中去跑，非常容易导致模型计算的失败或者可用性很差，所以数据预处理是数据挖掘过程中都不可或缺的一步。

至于数据挖掘和后处理相对来说就容易理解多了。完成了数据的预处理，我们通常进行特征构造，然后放到特定的模型中去计算，利用某种标准去评判不同模型或组合模型的表现，最后确定一个最合适的模型用于后处理。后处理的过程相当于已经发现了那个我们想要找到的结果，然后去应用它或者用合适的方式将其表示出来。

这里涉及到数据挖掘的一系列算法，主要分为分类算法，聚类算法和关联规则三大类，这三类基本上涵盖了目前商业市场对算法的所有需求。而这三类里，最为经典的则是下面这十大算法。