书签 分享 收藏 举报 版权申诉 / 37
上传文档赚钱

类型大数据应用技术介绍(37张)课件.ppt

  • 上传人(卖家):晟晟文业
  • 文档编号:4094059
  • 上传时间:2022-11-10
  • 格式:PPT
  • 页数:37
  • 大小:2.86MB
  • 【下载声明】
    1. 本站全部试题类文档,若标题没写含答案,则无答案;标题注明含答案的文档,主观题也可能无答案。请谨慎下单,一旦售出,不予退换。
    2. 本站全部PPT文档均不含视频和音频,PPT中出现的音频或视频标识(或文字)仅表示流程,实际无音频或视频文件。请谨慎下单,一旦售出,不予退换。
    3. 本页资料《大数据应用技术介绍(37张)课件.ppt》由用户(晟晟文业)主动上传,其收益全归该用户。163文库仅提供信息存储空间,仅对该用户上传内容的表现方式做保护处理,对上传内容本身不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知163文库(点击联系客服),我们立即给予删除!
    4. 请根据预览情况,自愿下载本文。本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
    5. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007及以上版本和PDF阅读器,压缩文件请下载最新的WinRAR软件解压。
    配套讲稿:

    如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。

    特殊限制:

    部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。

    关 键  词:
    数据 应用技术 介绍 37 课件
    资源描述:

    1、2014年2月Sub Project描述描述common分布式文件系统和通用I/O的组件与接口(序列化,Java RPC和持久化数据结构)Avro支持高效的跨语言RPC和持久数据存储的序列化系统MapReduce分布式数据处理模型和执行环境,运行在大型商用机集群HDFS分布式文件系统,用于大型商用机集群PIGPig是SQL-like语言,是在MapReduce上构建的一种高级查询语言,把一些运算编译进MapReduce模型的Map和Reduce中,并且用户可以定义自己的功能。Hive分布式、按列存储的数据仓库。Hive管理HDFS中存储的数据,并提供基于SQL的查询语言(由运行时引擎翻译成Ma

    2、pReduce作业)Hbase分布式、按列存储的数据库。HBase使用HDFS作为底层存储,同时支持MapReduce的批量式计算和点查询(随机读取)ZooKeeper分布式、可用性高的协调服务。提供类似分布式锁的基础服务。Sqoop在数据库和HDFS之间高效传输数据的工具Flume分布式、可靠、和高可用的海量日志聚合的系统。ChukwaChukwa是基于Hadoop的大集群监控系统,由yahoo贡献。存储大文件百兆以上级别文件百万级文件由于亿级别文件流式处理数据一次写多次多模式支持追加操作廉价的硬件环境普通pc server组成集群环境低延时读操作 高吞吐量而非低延时 Hbase 解决了这个

    3、问题大量小数据文件 最好每个文件大于100M多次写 只支持一次写 只支持在文件尾部添加,不支持随机写JobTracker管理集群资源和Job调度TaskTracker管理Task运行Inputk1,v1Mapk2,v2Reducek3,v3OutputMapReduceInputFormatMapperPartitionerReducerOutputFormat 引入一个新的资源管理系统YARN HDFS单点故障得以解决 HDFS Federation HDFS 快照 通过NFS访问HDFS 支持Window系统n 1 高可靠性n 2 高效性n 3 面向列n 4 可伸缩n 5 可在廉价PC S

    4、erver搭建大规模结构化存储集群HBaseHBase 系统架构图系统架构图ClientClient:使用HBase RPC机制与HMaster和HRegionServer进行通信Client与HMaster进行通信进行管理类操作Client与HRegionServer进行数据读写类操作ZookeeperZookeeper:Zookeeper Quorum存储-ROOT-表地址、HMaster地址HRegionServer把自己以Ephedral方式注册到Zookeeper中,HMaster随时感知各个HRegionServer的健康状况Zookeeper避免HMaster单点问题HMaste

    5、rHMaster:HMaster没有单点问题,HBase中可以启动多个HMaster,通过Zookeeper的Master Election机制保证总有一个Master在运行主要负责Table和Region的管理工作:1 管理用户对表的增删改查操作2 管理HRegionServer的负载均衡,调整Region分布3 Region Split后,负责新Region的分布4 在HRegionServer停机后,负责失效HRegionServer上Region迁移Table&RegionTable&Regionn Table随着记录增多不断变大,会自动分裂成多份Splits,成为Regionsn 一

    6、个region由startkey,endkey)表示n 不同region会被Master分配给相应的RegionServer进行管理-ROOT-&.META.-ROOT-&.META.n.META.记录用户表的Region信息,同时,.META.也可以有多regionn-ROOT-记录.META.表的Region信息,但是,-ROOT-只有一个regionn Zookeeper中记录了-ROOT-表的locationn 客户端访问数据的流程:Client-Zookeeper-ROOT-.META.-用户数据表n 多次网络操作,不过client端有cache缓存HBaseHBase 数据模型数据

    7、模型Row Key:Table主键,Table中记录按照Row Key排序Timestamp:每次对数据操作对应的时间戳,也即数据的version numberColumn Family:列簇,一个table在水平方向有一个或者多个列簇,列簇可由任 意多个Column组成,列簇支持动态扩展,无须预定义数量及 类型,二进制存储,用户需自行进行类型转换n 数据类型:Hbase只有简单的字符串类型。n 数据操作:Hbase只有很简单的插入、查询、删除、清空操作,没有复杂的表和表之间的关系。n 存储模式:Hbase是基于列式存储,每个列族由几个文件保存,不同列族的文件是分离的。n 数据维护:更新操作是

    8、替换版本,删除只是逻辑标记n 可伸缩性:Tika是一个内容抽取的工具集合。支持work,ppt,execl,PDF等Elasticsearch:开源的分布式实时搜索系统,结合Hbase实现海量数据存储和检索,同时提供索引数据统计功能,满足海量数据的实时统计要求。ya主要功能特点主要功能特点 real time distributed high availability document oriented schema free restful api索引数据统计索引数据统计 min、max、sum、avg。stats、filter、missing rang、data range、ipv4 range histogram、date hitogramThank You!Thank You!

    展开阅读全文
    提示  163文库所有资源均是用户自行上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作他用。
    关于本文
    本文标题:大数据应用技术介绍(37张)课件.ppt
    链接地址:https://www.163wenku.com/p-4094059.html

    Copyright@ 2017-2037 Www.163WenKu.Com  网站版权所有  |  资源地图   
    IPC备案号:蜀ICP备2021032737号  | 川公网安备 51099002000191号


    侵权投诉QQ:3464097650  资料上传QQ:3464097650
       


    【声明】本站为“文档C2C交易模式”,即用户上传的文档直接卖给(下载)用户,本站只是网络空间服务平台,本站所有原创文档下载所得归上传人所有,如您发现上传作品侵犯了您的版权,请立刻联系我们并提供证据,我们将在3个工作日内予以改正。

    163文库