大数据处理的基本技术

文 | Smartbi大数据百科 2021-05-20 阅读次数:8879 次浏览

商业智能BI产品更多介绍:https://www.smartbi.com.cn/

商业智能BI产品更多介绍:点击前往

    大数据处理技术(一)分布式文件存储系统

    数据以块的形式,分布在集群的不同节点。在使用HDFS时,无需关心数据是存储在哪个节点上、或者是从哪个节点从获取的,只需像使用本地文件系统一样管理和存储文件系统中的数据。

    大数据处理技术(二)分布式计算框架

    分布式计算框架将复杂的数据集分发给不同的节点去操作,每个节点会周期性的返回它所完成的工作和最新的状态。

    计算机要对输入的单词进行计数:

    如果采用集中式计算方式,我们要先算出一个单词如Deer出现了多少次,再算另一个单词出现了多少次,直到所有单词统计完毕,将浪费大量的时间和资源。

    如果采用分布式计算方式,计算将变得高效。我们将数据随机分配给三个节点,由节点去分别统计各自处理的数据中单词出现的次数,再将相同的单词进行聚合,输出最后的结果。

    大数据处理技术(三)资源调度器

    相当于电脑的任务管理器,对资源进行管理和调度。

    大数据处理技术(四)分布式数据库

    分布式数据库是非关系型数据库,在某些业务场景下,数据存储查询在分布式数据库的使用效率更高。

    大数据处理技术(五)数据仓库

    数据仓库是基于Hadoop的一个数据仓库工具,可以用SQL的语言转化成MapReduce任务对hdfs数据的查询分析。数据仓库的好处在于,使用者无需写MapReduce任务,只需要掌握SQL即可完成查询分析工作。

    大数据处理技术(六)大数据计算引擎

    大数据计算引擎是专为大规模数据处理而设计的快速通用的计算引擎。

    大数据处理技术(七)机器学习挖掘库

    机器学习挖掘库是一个可扩展的机器学习和数据挖掘库。

申请试用 了解更多
Copyright© 广州思迈特软件有限公司  粤ICP备11104361号

电话咨询

售前咨询
400-878-3819 转1

售后咨询
400-878-3819 转2
服务时间:工作日9:00-18:00

sales邮箱

商务咨询请联系邮箱

邮箱地址:sales@smartbi.com.cn