精华内容
下载资源
问答
  • 数据挖掘本质

    千次阅读 2013-09-02 00:15:26
    本文是《大数据 互联网大规模数据挖掘与分布式处理》一书中第一章第一小节的学习笔记 数据挖掘(data minning)是数据“模型”的发现过程。 关于模型的定义,可以从统计学、机器学习和算法三个方面进行研究。 ...

    本文是《大数据 互联网大规模数据挖掘与分布式处理》一书中第一章第一小节的学习笔记

    数据挖掘(data minning)是数据“模型”的发现过程。

    关于模型的定义,可以从统计学、机器学习和算法三个方面进行研究。

    统计学

    认为数据挖掘就是统计模型(statistical model)的构建过程,这个统计模型指的就是课件数据所遵从的总体分布。

    如对一个数据序列进行统计,并假设为其服从高斯分布,通过对该数据序列计算得到的均值和方差就是对该高斯分布序列的完整刻画。


    机器学习

    通过机器学习进行数据挖掘时这样的:将数据当做训练集来训练某类算法,训练后的模型就是数据挖掘得到的模型。

    使用机器学习进行挖掘的前提是研究对象比较复杂,很难用传统的方式对其进行数学建模和分析。

    常用的方法有:贝叶斯网络、支持向量机、决策树、隐马尔科夫模型等。


    算法

    对大部分数据建模方法可以描述为下列两种做法之一:

    1.对数据进行简洁的汇总描述;(数据汇总,如google的PageRnk,聚类分析等)

    2.从数据中抽取出最突出的特征来代替数据并将剩余内容忽略;(特征抽取,如频繁项集,相似项等)

    展开全文
  • 数据分析、数据挖掘本质

    千次阅读 2017-08-26 17:44:42
    观点一,如上图所示,数据是信息的载体,信息是数据本质 观点二,任何对于数据的分析和挖掘的做法,实质上都是对于信息的加工和转换。 观点三,在将信息记录成数据的过程中,可能产生信息的损失。 观点四,在数据...

    观点一,如上图所示,数据是信息的载体,信息是数据的本质

    观点二,任何对于数据的分析和挖掘的做法,实质上都是对于信息的加工和转换。

    观点三,在将信息记录成数据的过程中,可能产生信息的损失。

    观点四,在数据的传输过程中可能产生数据的损失,同时也就是信息的损失。

    观点五,在从数据还原成信息的过程中很可能产生理解的偏差,造成信息的损失。




    如上图所示,数据分析挖掘的过程也就是从信息A到信息B*的过程;

    信息A记录成数据A,数据A经过传输变成数据A*,可能不再等于数据A;

    数据A*经过清洗过程变成信息A*,信息A*与信息A的差异也就是数据清洗要解决的问题。数据清洗应该尽量保证它们一致。

    信息A*经历转换(可能是汇总、分类、聚类、机器学习等)变成信息B;

    信息B被记录成数据B;

    数据B经过传输给到数据消费方,变成数据B*,同样有可能与数据B不同。

    数据B*被数据消费方理解为信息B*,这与原信息B之间有可能存在不同或者误解。


    这就是从宏观上看的一个流程。

    展开全文
  • 专家观点:数据挖掘本质

    千次阅读 2013-07-16 16:57:08
    专家观点:数据挖掘本质 转自:http://www.google.com/group/dm-club/web/%E4%B8%93%E5%AE%B6%E8%A7%82%E7%82%B9%EF%BC%9A%E6%95%B0%E6%8D%AE%E6%8C%96%E6%8E%98%E7%9A%84%E6%9C%AC%E8%B4%A8 ...

    专家观点:数据挖掘的本质



    转自:http://www.google.com/group/dm-club/web/%E4%B8%93%E5%AE%B6%E8%A7%82%E7%82%B9%EF%BC%9A%E6%95%B0%E6%8D%AE%E6%8C%96%E6%8E%98%E7%9A%84%E6%9C%AC%E8%B4%A8

    J.H.Friedman
    斯坦佛大学统计系及线性加速中心

    摘要:DM(数据挖掘)是揭示存在于数据里的模式及数据间的关系的学科,它强调对大量观测到的数据库的处理。它是涉及数据库管理,人工智能,机器学习,模式识别,及数据可视化等学科的边缘学科。用统计的观点看,它可以看成是通过计算机对大量的复杂数据集的自动探索性分析。目前对该学科的作用尽管有点夸大其词,但该领域对商业,工业,及科学研究都有极大的影响,且提供了大量的为促使新方法的发展而进行的研究工作。尽管数据挖掘和统计分析之间有明显的联系,但迄今为止大部分的数据挖掘方法都不是产生于统计学科。这篇文章对这一现象作了一些解释,并说明了为什么统计学家应该关注数据挖掘。统计学可能会对数据挖掘产生很大影响,但这可能要求统计学家们改变他们的一些基本思路及操作原则。

    1 序言

    声明:该文中的观点仅代表作者本人的观点,并不一定反映编辑,主办者,斯坦佛大学及同行的观点。

    第二十九次论坛(on the Interface)(May 1997,Houston,TX)的主题是数据挖掘和大数据集的分析。这次会议的主题和二十年前的一次由Leo Breiman组织,ASA 和IMS赞助的关于大量复杂数据分析的会议是一致的。二十年后,探讨一下二十年来的所作所为是极其恰当的。这篇文章将讨论如下问题:
        什么是数据挖掘?
        什么是统计?
        它们之间的联系是什么(如果有的话)?
        统计学家能作什么?(可能的话)
        未来走向何方?


    2 什么是数据挖掘?

    数据挖掘的定义非常模糊,对它的定义取决于定义者的观点和背景。如下是一些DM文献中的定义:数据挖掘是一个确定数据中有效的,新的,可能有用的并且最终能被理解的模式的重要过程。--Fayyad.

    数据挖掘是一个从大型数据库中提取以前未知的,可理解的,可执行的信息并用它来进行关键的商业决策的过程。--Zekulin.

    数据挖掘是用在知识发现过程,来辩识存在于数据中的未知关系和模式的一些方法。--Ferruzza

    数据挖掘是发现数据中有益模式的过程。--Jonn

    数据挖掘是我们为那些未知的信息模式而研究大型数据集的一个决策支持过程。--Parsaye


    数据挖掘是...
      .决策树
      .神经网络
      .规则推断
      .最近邻方法
      .遗传算法
    --Mehta

    虽然数据挖掘的这些定义有点不可触摸,但在目前它已经成为一种商业事业。如同在过去的历次淘金热中一样,目标是`开发矿工`。利润最大的是卖工具给矿工,而不是干实际的开发。数据挖掘这个概念被用作一种装备来出售计算机硬件和软件。
    硬件制造商强调数据挖掘需要高的计算能力。必须存储,快速读写非常大的数据库,并将密集的计算方法用于这些数据。这需要大容量的磁盘空间,快速的内置大量R AM的计算机。数据挖掘为这些硬件打开了新的市场。

    软件提供者强调竞争优势。`你的对手使用它,你最好得跟上。`同时强调它将增加传统的数据库的价值。许多组织在处理存货,帐单,会计的数据库方面有大量的业务。这些数据库的创建和维护都耗资巨大。现在只需要将相对少的投资用于数据挖掘工具,就可以发现隐藏在这些数据中的具有极高利润的信息` 金块`。

    目前硬件和软件供应者的目的是在市场还未饱和前通过迅速推出数据挖掘产品为数据挖掘作广告。如果一个公司为数据挖掘包投资了五万至十万美元,这也可能只是实验,人们在新产品未被证实比旧产品具有很大优势之前是不会贸然购买的。以下是一些当前的数据挖掘产品:
      IBM: `Intelligent Miner` '智能矿工'
      Tandem: 'relational Data Miner' '关系数据矿工'
      AngossSoftware: 'KnowledgeSEEDER' `知识搜索者`
      Thinking Machines Corporation: 'DarwinTM' 
      NeoVista Software: 'ASIC'
      ISL Decision Systems,Inc.: 'Clementine' `克莱门小柑橘` 
      DataMind Corporation: 'DataMind Data Cruncher' 
      Silicon Graphics: 'MineSet' 
      California Scientific Software: 'BrainMaker' 
      WizSoft Corporation: 'WizWhy' 
      Lockheed Corporation: 'Recon' 
      SAS Corporation: 'SAS Enterprise Miner '

    除了这些`综合`软件包外,还有许多专门用途的产品。另外,许多专业于数据挖掘的咨询公司也成立了。在这个领域,统计学家和计算机科学家的不同在于当统计学家有一个想法时,他(她)将它写成文章,而计算机科学家者开一家公司。
    当前数据挖掘产品的特点有:
      --迷人的图形用户界面
        .数据库(查寻语言)
        .一套数据分析过程
      --窗口形式的界面
        .灵活方便的输入
      --点击式按键和输入对话框
      --利用图表分析
      --复杂的图形输出
      --大量数据图
      --灵活的图形解释
        树,网络,飞行模拟
      -- 结果方便的处理。
    这些软件包对决策者来说就象数据挖掘专家。
    在当前的数据挖掘软件包中被用到的统计分析过程包括:
      .决策树推断(C4.5,CART,CHAID)
      .规则推断(AQ,CN2,RECON,etc)
      .最近邻方法(合乎情理的方案)
      .聚类方法(数据分离)
      .联合规则(购物篮分析)
      .特征抽取
      .可视化
    另外,有些还包括:
      .神经网络
      .贝叶斯信念网络(图形模型)
      .遗传算法
      .支持向量机
      .自组织图
      .神经模糊系统
    几乎所有包都不包括:
      .假设检验
      .实验设计
      .响应表面模型
      .ANOVA,MANOVA,etc.
      .线性回归
      .判别分析
      .对数回归
      .广义线性模型
      .正则相关性
      .主成分分析
      .因子分析
    后面的这些过程是标准统计包里的主要部分。因此,当前被市场化的数据挖掘包中的大部分方法在统计学科之外产生和发展。统计学核心的方法已被忽略。

    3 Why Now? What's the rush?

    从数据学习的想法已经提出很长时间了。但在忽然之间人们对数据挖掘的兴趣却变得如此强烈,这是为什么呢?主要原因是近来它与数据库管理领域有了联系。数据,特别大量的数据保存在数据库管理系统中。传统的DBMS集中于在线处理过程(OLTP n-line transaction processing);也就是数据组织的目的是存储并快速恢复单个记录。它们过去常用来记录库存,薪水表记录,帐单记录,发货记录,等等。
        最近,数据库管理界对将数据库管理系统用于决策支持越来越感兴趣。这样一个决策支持系统将允许对原本为在线转换过程应用收据的数据进行统计查询。比如` 上月我们的所有连锁店一共卖了多少尿布?`,决策支持系统需要`数据仓库`的结构。数据仓库用相同的格式将某组织分散在各个部门的数据统一成一个单一的中心数据库(通常有1 00GB大)。有时较小一点的子数据库也可以建成来进行特殊的分析;这些又叫`数据市场`(Data Marts)

    决策支持系统为在线分析过程(OLAP)和关系在线分析过程设计。关系在线分析过程为`多维分析`设计。关系在线分析过程数据库通过维组织,维即属性(变量)的逻辑类。数据体可以看成是高维偶然事件表。关系在线分析过程支持如下类型的查询:
    .显示春季运动服部门总的销售量,及California大城市商业街中商店数
    .和小城市中商店进行比较
    .显示所有利润边界值为负的项

    如果关系在线分析过程的查寻由使用者手工进行,使用者提出潜在的相关问题;得到结果需要附加的查寻,其答案可能暗示进一步的问题。这样的分析过程一直到不再有感兴趣的问题提出,或者到分析员精疲力尽或耗完时间。如果用关系在线分析过程进行数据挖掘,那它需要一个经验丰富的使用者,他能不睡且不老,使用者必须不断地重复提出见闻广博的问题。
        数据挖掘也可以用数据挖掘系统(软件)进行,它只需要使用者提供模糊的指令,就能自动搜索相应的模式,并显示重要的项,预测,或反常记录。

    .利润边界值为负的项有什么特征?
    .如果决定开发某项产品的市场-预测它的利润边界值
    .寻找那些其利润边界值可以准确预测的项的特征
    不是所有的大的数据库都是商业化的,比方说科学和工程中大量存在的数据库。这些数据库通常和计算机自动收据数据联系在一起,比方说:
    .天文的(天空图)
    .气象的(气候,环境污染监测站)
    .卫星遥感
    .高能物理
    .工业过程控制
    这些数据也能得益于数据挖掘技术(原则上)

    4 是数据挖掘还是智能训练?

    当前对数据挖掘的兴趣在学术界引发了一些议题。数据挖掘作为一种商业事业看上去很可行,但它是否能被定为一种智能训练。当然它和计算机科学有极重要的联系。这些包括:
    .集聚体(ROLAP)的高效计算
    .快速的立体(X * X)查寻
    .为提高在线查寻的速度的线下预查寻
    .在线查寻的并行计算
    .将DBMS方法转化为数据挖掘算法。
    .基于磁盘而不是RAM的实现
    .基本数据挖掘算法的并行实现
    从统计数据分析的眼光我们可以问数据挖掘方法是否是智能训练。到目前为止,仍可以说它是,也可以说不是。数据挖掘包中广为人知的程序来自机器学习,模式识别,神经网络和数据可视化领域。它们强调` 看和感觉`和感官性的存在。这样看上去并不是在意具体的表现,而是要迅速占领市场。在这个领域中目前大部分的研究集中在改进当前的机器学习方法和加速已存在的算法。
    然而,在将来数据挖掘几乎可以肯定地说是一种智能训练。当一种技术的效率提高了十倍,人们总要认真地重新考虑怎样应用它。想一想人类从走到飞的历史进程,每一次提高都大约是以前的十倍,并且每一次量的提高都重新改变了我们对如何使用交通工具的想法。C huck Dickens(前SLAC的计算指导)曾说到:`每次计算机的能力提高十倍,我们都应该从总体上重新思考一下我们应该怎样算,算什么的问题。` 一个相应的说法可能是`每次数据量增加十倍,我们就应该从总体上重新考虑一下怎样分析它。`从当前几乎大多数使用的数据挖掘工具发明的那一段时间到现在,计算机的处理能力和数据量都增加了好几个数量级。新的数据挖掘方法在将来一定会更智能更有学术性( 商业性)。

    5 数据挖掘应该是统计的一部分吗?

    我们过去曾给予数据挖掘方法智能的生命力,但统计学作为一个学科是否应该关心它的发展。我们是否应该将它看成统计的一部分?那意味作什么?最起码它表明我们应该:
    .在我们的杂志上发表这类文章。
    .在我们的本科课程中讲授一些这方面的内容 ?br> .在我们的研究生中讲授一些相关的研究课题。
    .给那些这方面较优秀的人提供一些奖励(工作,任期,奖品)。
    答案并不明显,在统计学的历史上就忽略了许多在其它数据处理相关领域发展的新方法。如下是一些相关领域的例子。其中带*的是那些在统计科学中萌芽,但随后绝大部分又被统计学忽略的方法领域。
    1 模式识别*--CS/工程
    2 数据库管理--CS/图书馆科学
    3 神经网络*--心理学/CS/工程
    4 机器学习*-CS/AI
    5 图形模型*(Beyes 网)-CS/AI
    6 遗传工程--CS/工程
    7 化学统计学*--化学
    8 数据可视化**--CS/科学计算
    可以肯定地说,个别的`统计学家`已经致力于这些领域,但公平地说他们并未被我们的统计学领域拥抱(或者说热情地拥抱)。

    6 什么是统计学?

    既然象上面的一些从数据获取知识的课题和统计学的关系如此冷淡,我们不禁要问:`

    什么不是统计学`。如果和数据联系并不是一个课题成为统计学一部分的充分理由,那么什么才是充分的呢?到目前为止,统计学的定义好象依赖于一些工具,也就是我们在当前的研究生课程中讲授的那些东西。如下是一些例子:
    .概率理论
    .实分析
    .测度论
    .渐近理论
    .决策理论
    .马耳可夫链 
    .鞅
    .遍历理论
    .等
        统计领域好象被定义成一族能提出如上或相关工具的问题。当然这些工具过去和将来都会很有用。就象Brad Efron提醒我们一样:`统计是最成功的信息科学。`,`那些忽略了统计的人将受到惩罚,他们将在实际中自己重新发现该统计方法。`
        有人认为在当前数据(及其相关应用)以指数方式增长,而统计学家的数量显然赶不上这种增长的情况下,我们统计学应该将精力集中于信息科学中我们作得最好的部分,也就是基于数学的概率推断。这是一种高度保守的观点,当然它也有可能是最好的一种战略。然而,如果我们接受这一种观点,我们统计学家在‘信息革命’浪潮中的作用肯定会逐渐消失殆尽(在这个舞台上的演员越来越少)。当然这种战略的一个很好的优点是它对我们创新的要求很少,我们只需要墨守成规就可以了。
        另一种观点,早在1962年就由John Tukey[Tukey (1962)]提出来了,他认为统计应该关注数据分析。这个领域应该依据问题而不是工具定义,也就是那些和数据有关的问题。如果这种观点成为一种主流观点,那就要求对我们的实践和学术课题作较大的改变。
        首先(最重要的),我们应该跟上计算的步伐。哪里有数据,哪里就有计算。 一旦我们将计算方法看成是一个基本的统计工具(而不是一种方便地实现我们现成工具的方法),那么当前许多和数据密切相关的领域将不复存在。他们将成为我们领域的一部分。
        认真对待计算工具而不是简单地使用统计包--虽然这一点也很重要。如果计算成为我们的一个基本的研究工具,毫无疑问,我们的学生应该学习相关的计算科学知识。这将包括数值线性代数,数值和组合优化,数据结构,算法设计,机械体系,程序设计方法,数据库管理,并行体系,和程序设计等等。我们也将扩展我们的课程计划,它应该包括当前的计算机定向数据分析方法,它们大部分是在统计学科之外发展起来的。
        如果我们想和其它的数据相关领域争夺学术和商业的市场空间,我们的某些基本模式将不得不改变,我们将不得不调节对数学的幻想。数学(象计算)只是统计的一个工具,虽然非常重要,但并不是唯一能证实统计方法有效性的工具。数学不等价于理论,反之亦然。理论本来是创造理解力和数学,虽然这很重要,但并不是作此的唯一方法。比如,在疾病的基因理论中数学内容很少,但它却使人们更好地理解许多医学现象。我们将承认经验确认方式,虽然有一定局限性,但的确是一种确认方式。
        我们可能也不得不改变我们的文化。每一个参与其它数据相关领域的统计学家都被他们和统计学的‘文化差距’所震撼。在其它的一些领域,‘想法’比数学技术(基础)更重要。一个有启发的‘想法’就被认为是有价值的,若有更详细的确认(理论的或经验的)人们才去讨论它的最终价值。思维方式是‘如果没有证明是有罪的,那就是清白的’这和我们领域的思路是不一致的。过去如果一个新方法不是用数学证明是有效的,我们常常诋毁它,即使不这样,我们也不会接受它。这种思路在数据集比较小和信息噪声比较高时是合理的。特别地,我们应该改变我们诋毁那些表现很好(通常在其它领域),但却没被我们理解的方法的习惯。

    7 走向何方?

    也许,现在的统计学正处在一个十字路口,我们可以决定是接受还是拒绝改变。如上所说,两种观点都极富说服力。虽然观点丰富,但谁也不能肯定哪一种战略能保持我们领域的健康发展和生命力。大多数统计学家好象认为统计学对信息科学的影响越来越小。它们也不太同意为此作些什么。站主导的观点认为我们有市场问题,我们在别的领域的顾客和同事不了解我们的价值和重要性。这也是我们的主要专业组织,美国统计协会的看法。在战略计划委员(A mstat News-Feb.1997)会所作的五年计划报告中有一节‘增强我们学科的声望和健康’。建议作三方面的工作:
    .
    .
    (以下的内容意思是:统计学面临危机,市场的,人才的危机。统计学可以在数据挖掘科学中发挥作用,统计学应该和数据挖掘合作,而不是将它甩给计算机科学家。) 
    参考:Tukey,J.W.(1962).数据分析的未来 Ann.Statist.33,1-67

    展开全文
  • 关联分析是数据挖掘本质

    千次阅读 2009-02-10 16:07:00
    一般教科书上讲数据挖掘技术,主要讲关联规则、分类、聚类、异常检测。而关联规则的代表应用是购物篮分析。而事实上,关联分析的概念要远远广于一般教科书上所讲的关联规则挖掘。数据分析找出一个参量与另外参量的...

    一般教科书上讲数据挖掘技术,主要讲关联规则、分类、聚类、异常检测。而关联规则的代表应用是购物篮分析。而事实上,关联分析的概念要远远广于一般教科书上所讲的关联规则挖掘。数据分析找出一个参量与另外参量的关联,很多时候是想进行因果关联分析,即通过数量关联、时序关联的分析进行原因关联分析,而购物篮分析应用只是关联分析的典型应用。

    展开全文
  • 数据挖掘面试 150 道题(附答案)

    万次阅读 多人点赞 2019-09-21 13:50:38
    1. 某超市研究销售纪录数据后发现,买啤酒的人很大概率也会购买尿布,这种属于数据挖掘的哪类问题?(A) A. 关联规则发现 B. 聚类 C. 分类 D. 自然语言处理 2. 以下两种描述分别对应哪两种对分类算法的评价标准...
  • 数据挖掘本质和意义

    万次阅读 2017-05-13 15:30:15
    数据挖掘本质就是对历史数据进行碰撞,挖掘出看似违背常理,其实情理之中的一些潜在的规则和规律。他的意义就是利用潜在的规则和规律预测到人类预测不到的、未来一定会发生的事情。  说起大数据挖掘,它就是...
  • 数据挖掘

    千次阅读 多人点赞 2019-04-16 16:26:36
    数据挖掘其实是一种深层次的数据分析方法。数据挖掘可以描述为:按企业...数据挖掘与传统的数据分析(如查询、报表、联机应用分析)的本质区别是数据挖掘是在没有明确假设的前提下去挖掘信息、发现知识。数据挖掘...
  • OLAP和数据挖掘

    2012-09-30 00:17:02
    数据挖掘本质上是一个归纳的过程 OLAP,是验证假设的过程 数据挖掘和OLAP都是在数据仓库的基础上进行的。
  • 数据挖掘本质上像是机器学习和人工智能的基础,它的主要目的是从各种各样的数据来源中,提取出超集的信息,然后将这些信息合并让你发现你从来没有想到过的模式和内在关系。这就意味着,数据挖掘不是一种用来证明假说...
  • I . 数据挖掘引入 II . 数据挖掘简介 III . 数据挖掘 与 KDD ( Knowledge Discovery From Data ) 从数据到知识 IV . 数据挖掘中的数据源 V . 数据挖掘中的特点
  • 数据挖掘的意义是什么?

    千次阅读 2018-07-04 16:01:03
    数据挖掘本质上像是机器学习和人工智能的基础,它的主要目的是从各种各样的数据来源中,提取出超集的信息,然后将这些信息合并让你发现你从来没有想到过的模式和内在关系。这就意味着,数据挖掘不是一种用来证明假说...
  • 1.什么是数据挖掘数据挖掘是人工智能和数据库领域研究的热点问题,所谓数据挖掘是指从数据库的大量数据中揭示出隐含的、先前未知的并有潜在价值的信息的非平凡过程。数据挖掘是一种决策支持过程,它主要基于人工...
  • 为什么要进行数据挖掘

    千次阅读 2018-12-13 11:10:47
    数据挖掘本质上像是机器学习和人工智能的基础,它的主要目的是从各种各样的数据来源中,提取出超集的信息,然后将这些信息合并让你发现你从来没有想到过的模式和内在关系。这就意味着,数据挖掘不是一种用来证明假说...
  • 数据挖掘笔记

    千次阅读 2015-07-22 13:18:04
    数据挖掘笔记
  • 数据挖掘】之 数据挖掘 绪论

    万次阅读 2020-04-28 23:35:42
    1.什么是数据挖掘 数据挖掘是在大型数据存储库中,自动地发现有用信息的过程。数据挖掘技术用来探查大型数据库,发现先前未知的有用模式。数据挖掘还可以预测未来观测结果。 并非所有的信息发现任务都被视为数据...
  • 一、数据挖掘、知识发现的概念 数据挖掘 Data Mining :是指从海量的数据中通过相关的算法发现隐藏在数据中的规律和知识的过程。 知识发现:数据挖掘是知识发现中的一个步骤。当提到“数据挖掘”时,通常情况下要...
  • 数据挖掘中所需的概率论与数理统计知识

    万次阅读 多人点赞 2012-12-17 19:24:47
    数据挖掘中所需的概率论与数理统计知识  (关键词:微积分、概率分布、期望、方差、协方差、数理统计简史、大数定律、中心极限定理、正态分布)   导言:本文从微积分相关概念,梳理到概率论与数理统计中的...
  • 数据挖掘系列之二:数据挖掘概述

    千次阅读 多人点赞 2012-11-03 17:28:00
    1.why(为什么需要数据挖掘) 数据库系统经历了如下的技术演变:数据收集和数据库创建,数据管理(DBMS,包括数据存储和检索,联机事务处理OLTP),以及高级数据分析(涉及数据仓库和数据挖掘)。当前常见的数据集...
  • Python数据挖掘简易入门

    千人学习 2020-03-11 14:47:29
    本课程为Python数据挖掘方向的入门课程,课程主要以真实数据为基础,详细介绍数据挖掘入门的流程和使用Python实现pandas与numpy在数据挖掘方向的运用,并深入学习如何运用scikit-learn调用常用的数据挖掘算法解决...

空空如也

空空如也

1 2 3 4 5 ... 20
收藏数 49,021
精华内容 19,608
关键字:

数据挖掘本质