学习大数据自己爬数据相关课程
  • 大数据数据仓库入门到精通

    中级课

    大数据数据仓库入门到精通
    72课时 1721分钟 王佳隆
    本课程以CDH作为大数据平台,详细介绍CDH平台各个组件在生产环境的应用及开发,并结合实际的业务场景,离线数仓,实时数仓,构建企业核心的数据架构。 在实际的工作当中,大数据架构,运维或者开发人员会与多个公司团队合作,ETL团队,爬虫团队,算法团队,运营团队等等,指导大家如何与个个团队打交道,提升工作效率。减少团队之间不愉快的沟通。 希望学习者最好从事过数据库相关工作,有一些 JAVA开发基础,或者有其他工作经验,想学习大数据及数据仓库的同学,对于没有工作经验,或者对开发,数据完全小白的同学,建议先了解相关知识再学习。 本课程的宗旨只有一条,任何学习完本课程的同学,都能熟悉企业主流的数据架构,都有能力维护一个中等HADOOP集群,也就是1P左右的数据的集群或者多个集群。
    免费试看
  • 大数据Java强化班(七)之集合

    初级课

    大数据Java强化班(七)之集合
    38课时 253分钟 杨俊
    课程由猎豹移动大数据架构师,根据Java在公司大数据开发中的实际应用,精心设计和打磨的大数据必备Java课程。通过本课程学习大数据新手能够少走弯路,以最短的时间系统掌握大数据开发必备语言Java,为后续大数据课程的学习奠定了坚实的语言基础。 课程特色 1.课程是由猎豹移动大数据架构师亲自授课 2.课程理论讲解透彻形象,手把手实战操作 3.课程包含大数据开发必备的所有Java知识 4.课程前后连贯、系统完整,不会出现跳讲和断讲 技术说明 1. 语言版本:JDK1.8 2. 开发工具:Eclipse 课程资料 免费提供完整的PPT资料 免费提供完整的Word文档 免费提供完整的随堂笔记 免费提供完整的课程代码 免费提供完整的软件包
    免费试看
  • Python数据分析师、大数据、云计算、冲击高薪

    高级课

    Python数据分析师、大数据、云计算、冲击高薪
    9课时 150分钟 张敏
    适用人群:有基础的;想系统学习和提高的;想步入手机APP测试领域的;感兴趣的;但好有一定的代码基础,因为一些太基础的不会再次重复!友情提示,觉得自己是高手的请绕行! 课程特点:知识脉络清晰(包括但不限于下方内容) 1.掌握移动手机app自动化测试框架设计的思路 2.掌握移动手机app性能测试的方法,利用traceview完成 3.掌握移动手机app自动化测试框架robotium 4.掌握移动手机app自动化测试框架Appium 5.掌握移动手机app持续集成jenkins QQ群288567073
    免费试看
  • 大数据工程师新手必学实战:手把手教你做一份大数据行业分析报告

    初级课

    大数据工程师新手必学实战:手把手教你做一份大数据行业分析报告
    7课时 108分钟 CSDN就业班
    使用python语言进行大数据岗位需求数据分析 从基础的原始数据获取到数据探索分析 使用pandas和其他第三方库实现城市平均工资、城市岗位需求占比、技术要求词频统计业务。
    免费试看
  • Python玩转大数据--105精讲视频

    中级课

    Python玩转大数据--105精讲视频
    105课时 1694分钟 张敏
    该课程采用时下后的编程语言Python讲解,囊括了当前火的大数据技术Spark/Hadoop/Hive知识,学习环境是基于Docker搭建的5个容器。通过这门课程不仅可以学到Spark/Hadoop/Hive大数据知识,还可以学到当下后的云计算技术Docker. 任务作业: 很多人都想入门机器学习和人工智能,挑战高薪!殊不知人工智能和机器学习的基础是数据及数学,特别是在大数据时代,90%以上的公司不单单是招聘算法工程师,到猎聘Boss直聘上查找算法岗位,查看其招聘条件往往都需要熟练使用大数据平台。这门课程涵盖Docker云计算容器技术,要求学员学完本门课程能够使用Docker容器部署4个容器的Spark集群并能用学到的Docker技术制作一个微服务镜像并对外提供服务;本课程全面讲解了Spark原理及接口,要求学员学完本课程能用网络爬虫爬取全国各地的房价数据,并用Spark编写mapreduce程序分析房价分布情况;本课程涉及分布式机器学习SparkML,要求学员学完本课程,能用SVR,LinearRegreesion,多层感知机算法,决策树回归算法等算法进行房价预测。 人人都想入门人工智能,殊不知人工智能的入门准则是基础的算法和数据处理的能力,学完本课程希望人人拿高薪! (注意: 作业需写在CSDN博客中,请把作业链接贴在评论区,老师会定期逐个批改~~)
    免费试看
  • 大数据Java强化班(二)之数据结构与排序算法

    初级课

    大数据Java强化班(二)之数据结构与排序算法
    44课时 499分钟 杨俊
    课程由猎豹移动大数据架构师,根据Java在公司大数据开发中的实际应用,精心设计和打磨的大数据必备Java课程。通过本课程学习大数据新手能够少走弯路,以最短的时间系统掌握大数据开发必备语言Java,为后续大数据课程的学习奠定了坚实的语言基础。 课程特色 1.课程是由猎豹移动大数据架构师亲自授课 2.课程理论讲解透彻形象,手把手实战操作 3.课程包含大数据开发必备的所有Java知识 4.课程前后连贯、系统完整,不会出现跳讲和断讲 技术说明 1. 语言版本:JDK1.8 2. 开发工具:Eclipse 课程资料 免费提供完整的PPT资料 免费提供完整的Word文档 免费提供完整的随堂笔记 免费提供完整的课程代码 免费提供完整的软件包 课程目标 1.熟练掌握大数据Java SE基础,具备大数据源码开发的能力。 2.熟练掌握Java排序算法、单例模式、多线程、JVM等,应对大数据Java面试。 3.为大数据学习打下坚实的Java 语言基础。
    免费试看
  • Python爬虫视频教程:教你爬取QQ音乐数据(实战处理+数据可视化)

    中级课

    Python爬虫视频教程:教你爬取QQ音乐数据(实战处理+数据可视化)
    7课时 210分钟 刘宇宙
    本视频课程主要培训Python爬虫入门,数据分析及数据可视化实战内容,通过本课的学习,您可以在2小时左右掌握Python基础编程的核心内容,实现Python在爬虫、数据分析,及数据可视化等操作,各位同学在掌握了Python后,可以选择Python的其中一个方向进行深入研究,不管对于自身升职找工作,还是对于自身IT专业能力的提升,都是非常有帮助的。 刘宇宙,《Python3.5从零开始学》、《Python3.7从零开始学》一书作者。 目前主要担任大数据人工智能后台技术负责,负责人工智能项目落地,目前已落地计算机视觉中的以图搜图、侵权图片检测、智能广告、实时推荐、销量预测等项目。 先后从事过卡系统研发,云计算中IAAS的研发,大数据研发,物联网研发,网络爬虫研发。
    免费试看
  • 大数据之hbase详解

    高级课

    大数据之hbase详解
    24课时 273分钟 冯文凯
    HBase的原型是Google的BigTable论文,受到了该论文思想的启发,目前作为Hadoop的子项目来开发维护,用于支持结构化的数据存储.HBase是一个高可靠性、高性能、面向列、可伸缩的分布式存储系统,利用HBASE技术可在廉价PC Server上搭建起大规模结构化存储集群。本视频从hbase的概述开始,讲解hbase的安装,hbase的shell操作,数据结构和原理到java api操作以及优化,让我们快速上手hbase.
    免费试看
  • 大数据之kafka详解

    高级课

    大数据之kafka详解
    23课时 317分钟 冯文凯
    Apache Kafka是一个开源消息系统,由Scala写成。是由Apache软件基金会开发的一个开源消息系统项目.在流式计算中,Kafka一般用来缓存数据,Storm通过消费Kafka的数据进行计算。Kafka是一个分布式消息队列。本教程从kafka概述开始,讲解了kafka的集群部署,详细的工作流程,java api操作,kafka的拦截器,以及kafka streams和kafka与flume的交互.让你快速上手kafka.
    免费试看
  • 爬虫微课5小时 Python学习路线

    中级课

    爬虫微课5小时 Python学习路线
    30课时 300分钟 余强
    Python爬虫技术视频教程,该课程每堂课都有一个作业,包含的项目案例有家长帮142600条数据爬取与分析,全球天气数据抓取与分析,淘宝商品信息数据众数分析,12306余票查询,python软件打包exe与发布。学完此课程能让你对整个数据爬取数据分析有一个全新的了解,适当的深入则可以做这方面的工作
    免费试看
更多
免费试看
9084人学习 2704课时
介绍大数据技术生态圈主流技术框架的应用与发展,介绍如何搭建Hadoop大数据分布式系统集群平台、大数据分布式文件系统HDFS 、大数据分布式并行计算框架MapReduce。 本课程介绍大数据的学习基础。 本课程介绍大数据的背景。 带你深入了解大数据,对大数据有不同的认识。 介绍大数据的基本概念和技术生态圈。 本课程以杨力老师主编的《Hadoop大数据开发实战》为参考,书中详细的介绍了各个步骤,有需要的同学可以留意一下。 该课程的后续课程为杨力老师主讲的《hive大数据离线应用开发》,想要更进一步的同学可以继续观看杨老师的系列视频。
免费
免费试看
35288人学习 2477课时
大数据Spark实战视频培训教程:本课程内容涉及,Spark虚拟机安装、Spark表配置、平台搭建、快学Scala入门、Spark集群通信、任务调度、持久化等实战内容。Spark是UC Berkeley AMP lab (加州大学伯克利分校的AMP实验室)所开源的类Hadoop MapReduce的通用并行框架,Spark,拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是Job中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。
¥208.00 拼团
免费试看
13177人学习 65课时
Hadoop入门和大数据应用视频教程,该课程主要分享Hadoop基础及大数据方面的基础知识。 讲师介绍:翟周伟,就职于百度,Hadoop技术讲师,专注于Hadoop&大数据、数据挖掘、自然语言处理等领域。2009年便开始利用Hadoop构建商业级大数据系统,是国内该领域早的一批人之一,负责设计过多个基于Hadoop的大数据平台和分析系统。2011年合著出版《Hadoop开源云计算平台》。在自然语言处理领域申请过一项发明专利。新出版书籍 《Hadoop核心技术》 。
会员免费
免费试看
8678人学习 286课时
大数据技术在金融领域的应用与实战视频培训教程,系列课程是CSDN学院主题月专属视频,本期主题为 “金融大数据 ”,内容秉承干货实料的原则,邀请业内顶尖的数据技术讲师,共话大数据平台、Spark部署实践以及实现应用大数据支持业务发展等核心话题,旨在通过来自国内一线互联网公司的实践案例,为开发者提供一个有价值的高效技术交流平台,带你全面了解大数据在金融行业的应用与实战。
¥39.00 免费
免费试看
1719人学习 1721课时
本课程以CDH作为大数据平台,详细介绍CDH平台各个组件在生产环境的应用及开发,并结合实际的业务场景,离线数仓,实时数仓,构建企业核心的数据架构。 在实际的工作当中,大数据架构,运维或者开发人员会与多个公司团队合作,ETL团队,爬虫团队,算法团队,运营团队等等,指导大家如何与个个团队打交道,提升工作效率。减少团队之间不愉快的沟通。 希望学习者最好从事过数据库相关工作,有一些 JAVA开发基础,或者有其他工作经验,想学习大数据及数据仓库的同学,对于没有工作经验,或者对开发,数据完全小白的同学,建议先了解相关知识再学习。 本课程的宗旨只有一条,任何学习完本课程的同学,都能熟悉企业主流的数据架构,都有能力维护一个中等HADOOP集群,也就是1P左右的数据的集群或者多个集群。
¥800.00
免费试看
443人学习 832课时
随着大数据技术的不断发展壮大, Hive不再是大数据技术生态圈中一个普通的工具,而是在大数据分析和大数据仓库中占据着几乎不可替代的重要作用,大数据分析中Hive和Hbase、Hive和Spark SQL、Hive和Impala的结合使用愈加紧密,大数据仓库中Hive在数据仓库建模模块的作用暂时无可替代。所以,深入学好Hive是入门大数据分析、大数据仓库最好的选择。
¥199.00
免费试看
308人学习 718课时
    本课程中,你将学习到,项目架构搭建,数据生产,数据消费,数据分析,以及数据展示等项目核心业务功能的实现。学习过程中,我们将使用Flume,Kafka,HBase,Hadoop,Echarts,Crontab等大数据框架完成整个业务的实现,并在学习过程中对各个框架的应用和原理进行梳理和剖析。 【视频特点】 通信运营商每时每刻会产生大量的通信数据,例如通话记录,短信记录,彩信记录,第三方服务资费等等繁多信息。数据量如此巨大,除了要满足用户的实时查询和展示之外,还需要定时定期的对已有数据进行离线的分析处理。 电信客服综合案例就是以此为切入点所开发的大数据实战案例。  在本课程中,你将学习到,项目架构搭建,数据生产,数据消费,数据分析,以及数据展示等项目核心业务功能的实现。学习过程中,我们将使用Flume,Kafka,HBase,Hadoop,Echarts,Crontab等大数据框架完成整个业务的实现,并在学习过程中对各个框架的应用和原理进行梳理和剖析。
¥199.00 拼团
免费试看
223人学习 253课时
课程由猎豹移动大数据架构师,根据Java在公司大数据开发中的实际应用,精心设计和打磨的大数据必备Java课程。通过本课程学习大数据新手能够少走弯路,以最短的时间系统掌握大数据开发必备语言Java,为后续大数据课程的学习奠定了坚实的语言基础。 课程特色 1.课程是由猎豹移动大数据架构师亲自授课 2.课程理论讲解透彻形象,手把手实战操作 3.课程包含大数据开发必备的所有Java知识 4.课程前后连贯、系统完整,不会出现跳讲和断讲 技术说明 1. 语言版本:JDK1.8 2. 开发工具:Eclipse 课程资料 免费提供完整的PPT资料 免费提供完整的Word文档 免费提供完整的随堂笔记 免费提供完整的课程代码 免费提供完整的软件包
¥12.00
免费试看
701人学习 20课时
购买课程后,可扫码进入学习群,获取赵强老师答疑 本系列课程,完全免费,旨在帮助更多的学员了解大数据,包括:基本思想、Hadoop和Spark的基础知识,为进一步学习大数据奠定基础。
会员免费
免费试看
278人学习 549课时
如今大数据已经成了各大互联网公司工作的重点方向,而推荐系统可以说就是大数据最好的落地应用之一,已经为企业带来了可观的用户流量和销售额。特别是对于电商,好的推荐系统可以大大提升电商企业的销售业绩。国内外的知名电商,如亚马逊、淘宝、京东等公司,都在推荐系统领域投入了大量研发力量,也在大量招收相关的专业人才。打造的电商推荐系统项目,就是以经过修改的中文亚马逊电商数据集作为依托,并以某电商网站真实的业务架构作为基础来实现的,其中包含了离线推荐与实时推荐体系,综合利用了协同过滤算法以及基于内容的推荐方法来提供混合推荐。具体实现的模块主要有:基于统计的离线推荐、基于隐语义模型的离线推荐、基于自定义模型的实时推荐,以及基于内容的、和基于Item-CF的离线相似推荐。整个项目具有很强的实操性和综合性,对已有的大数据和机器学习相关知识是一个系统性的梳理和整合,通过学习,同学们可以深入了解推荐系统在电商企业中的实际应用,可以为有志于增加大数据项目经验的开发人员、特别是对电商业务领域感兴趣的求职人员,提供更好的学习平台。适合人群:1.有一定的 Java、Scala 基础,希望了解大数据应用方向的编程人员2.有 Java、Scala 开发经验,了解大数据相关知识,希望增加项目经验的开发人员3.有电商领域开发经验,希望拓展电商业务场景、丰富经验的开发人员4.有较好的数学基础,希望学br习机器学习和推荐系统相关算法的求职人员
¥128.00 拼团
免费试看
201人学习 804课时
通过此案例可以学习大数据整体开发流程,课程是围绕一个大数据整理流程而做的教学课程,让大家明白大数据不同技术的相互协调,从收集数据,过滤数据,数据分析,数据展示,调度的使用而开发的课程,而且怎么从hadoop,hive应用快速的过度到spark上面而做的整套流程。学完此课程可以企业流程做一个整体的认识。 配套资料-答疑专属答疑群 购买课程后加入qq群 951117762 (备注订单号后四位)
¥198.00 拼团
免费试看
695人学习 188课时
Spark大数据实时分析系统课程旨在帮助同学们收获一份有含金量、能写在简历上的项目经验,课程无死角讲解项目每个环节。课程内容涉及项目业务介绍、技术选型与架构设计、项目的架构演进、手机端到服务端数据流程、日志采集设计与要求、日志采集拓扑结构、线上和本地集群资源规划、项目全流程开发、项目总结、项目面试21问。项目内容比较丰满,零基础的同学可以从基础学到项目,有基础的同学可以直接选择项目学习。
免费
免费试看
2713人学习 606课时
本课程主要讲解在实际项目开发中,企业构建大数据平台的方案及实战。详细阐述企业级大数据平台的架构设计、机器选型、集群规划、技术选型、资源规划等技术方案。实战演练基于Cloudera Manager(CDH6)安装部署、监控管理、运营维护大数据平台的各个服务组件。从理论经验到实战演练,从设计思想到流程实施,亲力亲测,你也绝对可以。推荐进阶课程:大数据运维尖刀班
¥99.00
免费试看
529人学习 40课时
随着大数据与人工智能技术的应用普及,海量多源异构数据急剧增加。传统大数据平台在面临多源异构数据处理时,面临数据采集处理能力不足、数据结构难以统一,数据运维困难等挑战,为企业探索数据价值带来了层层阻碍。那么,有没有办法解决上述问题呢?答案是肯定的,浪潮商用机器有限公司推出的基于POWER9架构的Hadoop+Spark的异构大数据平台,将能轻松应对多样化并发处理任务,实现异构资源灵活调配,为企业提供一个完美的异构大数据解决方案。本次公开课力邀浪潮商用机器的资深专家——刘长生先生,为您带来《异构大数据平台,让多源异构数据融合贯通!》主题分享,详细解读该异构大数据解决方案,诚邀您参加!
免费
免费试看
1035人学习 1753课时
一、课程简介 随着技术的飞速发展,经过多年的数据积累,各互联网公司已保存了海量的原始数据和各种业务数据,所以数据仓库技术是各大公司目前都需要着重发展投入的技术领域。数据仓库是面向分析的集成化数据环境,为企业所有决策制定过程,提供系统数据支持的战略集合。通过对数据仓库中数据的分析,可以帮助企业改进业务流程、控制成本、提高产品质量等。 二、课程内容 本次精心打造的数仓项目的课程,从项目架构的搭建,到数据采集模块的设计、数仓架构的设计、实战需求实现、即席查询的实现,我们针对国内目前广泛使用的Apache原生框架和CDH版本框架进行了分别介绍,Apache原生框架介绍中涉及到的技术框架包括Flume、Kafka、Sqoop、MySql、HDFS、Hive、Tez、Spark、Presto、Druid等,CDH版本框架讲解包括CM的安装部署、Hadoop、Zookeeper、Hive、Flume、Kafka、Oozie、Impala、HUE、Kudu、Spark的安装配置,透彻了解不同版本框架的区别联系,将大数据全生态系统前沿技术一网打尽。在过程中对大数据生态体系进行了系统的讲解,对实际企业数仓项目中可能涉及到的技术点都进行了深入的讲解和探讨。同时穿插了大量数仓基础理论知识,让你在掌握实战经验的同时能够打下坚实的理论基础。 三、课程目标 本课程以国内电商巨头实际业务应用场景为依托,对电商数仓的常见实战指标以及难点实战指标进行了详尽讲解,具体指标包括:每日、周、月活跃设备明细,留存用户比例,沉默用户、回流用户、流失用户统计,最近连续3周活跃用户统计,最近7天内连续3天活跃用户统计,GMV成交总额分析,转化率及漏斗分析,品牌复购率分析、订单表拉链表的设计等,让学生拥有更直观全面的实战经验。通过对本课程的学习,对数仓项目可以建立起清晰明确的概念,系统全面的掌握各项数仓项目技术,轻松应对各种数仓难题。 四、课程亮点 本课程结合国内多家企业实际项目经验,特别加入了项目架构模块,从集群规模的确定到框架版本选型以及服务器选型,手把手教你从零开始搭建大数据集群。并且总结大量项目实战中会遇到的问题,针对各个技术框架,均有调优实战经验,具体包括:常用Linux运维命令、Hadoop集群调优、Flume组件选型及性能优化、Kafka集群规模确认及关键参数调优。通过这部分学习,助学生迅速成长,获取前沿技术经验,从容解决实战问题。
¥199.00
免费试看
560人学习 294课时
购买课程后,可扫码进入学习群,获取赵强老师答疑 本系列课程将基于RedHat Linux 7.4版本、Hadoop 2.7.3、Spark 2 版本全面介绍大数据的整体内容,让学员深入理解并掌握运行机制和原理,从而进一步掌握大数据的相关内容。
¥181.00
猜你喜欢