零门槛构建弹性大数据云分析平台

简介: 从基础设施、运维管理、云生态等角度,详细了解下云托管的部分优势。

作者:鲍远松
原文链接


大数据和大数据分析成为时下企业关注的焦点,大数据分析平台正在从企业的高配变为标配,是企业实现“一切业务数据化,一切数据业务化”目标的基础平台。

阿里云智能高级解决方案架构师鲍远松,分享《零门槛构建弹性大数据云分析平台》,过程中对大数据分析平台建设进行阶段划分,并对每阶段进行了详尽的阐述。

如下图,为大数据分析平台建设的四个阶段,分别是自建、云托管、云服务和云原生。

image.png

大数据分析平台建设之自建

  • 为什么要自建大数据分析平台呢?主要原因有三:
  1. 传统大数据分析技术已经不能满足大数据分析,需要通过引入新技术进行提升。
  2. 早期大数据技术相对不成熟、不可靠,需要专门的技术人才去研究。
  3. 市场上缺乏有效的大数据分析的成功案例和实践,企业必须摸着石头过河。
  • 自建大数据分析平台属于重资产模式,存在多方面不足,主要有如下几点:

周期长:整个建设周期特别长,涉及机房选择、硬件采购、集群部署、测试调优、数据服务、运维管理等诸多环节。

成本高:成本分为两类,一类是服务器、存储、网络、运维、IDC 等显性成本,另一类是业务影响、资源闲置、弹性扩容、一次性资金投入等隐性成本。这些成本的投入是确定的,但产出却是未知的。

门槛高:近些年大数据技术蓬勃发展,数据集成、数据存储、分析计算及数据作业每个维度都有很多细分的技术,任何一个技术都需要投入专人进行深入研究,对于普通企业来说人才门槛很高。

见效慢:大数据分析平台需要自始至终不断地进行迭代和修正,直至数据质量符合预期,数据分析结果可信,才能真正达到极致弹性性能、高可靠、多场景应用的效果。

大数据分析平台建设之云托管

自建大数据分析平台种种不足的背景下,云托管应需而生,原因有三:

  1. 企业甩掉重资产的包袱。
  2. 大数据技术趋于成熟,企业不再聚焦于大数据技术本身,而是需要一批具有大数据技能的人来做大数据的开发。
  3. 云厂商结合自身的优势,提供了云上大数据托管平台。

自建大数据分析平台通常是基于开源 Hadoop 平台,而云托管是把自建开源 Hadoop 平台转化为企业级、标准型大数据分析平台,具备统一集群管理、完备的监控报警、计算与存储分离、弹性扩容、按需构建、数据安全、低门槛运维、丰富云生态对接等优势。

EMR 提供了基础资源、平台管理、数据存储、数据集成、计算引擎、数据使用和作业管理等平台能力,对于所有组件都提供了完备的监控报警,任何组件异常都可以第一时间做报警并且通知到用户,同时基于平台提供了智能的运维管理、调度等功能。

接下来我们从基础设施、运维管理、云生态等角度,详细了解下云托管的部分优势。

云托管之基础设施

image.png

首先,云上有丰富的产品规格族,阿里云整个虚拟机分为通用计算、异构计算、裸金属&高性能计算三大类,每一类满足不同的场景,可以快速构建不同场景下的大数据分析平台。

其次,利用云的弹性,计算和存储资源可以进行独立扩充,满足业务高峰期或业务对极致性能的追求的同时,还可以灵活的按需构建。

最后,云上构建大数据分析平台在成本上可以做大量优化,可以根据业务特性灵活选择购买方式,如通过 Spot Instance 大幅降低计算节点的成本。

云托管之运维管理

image.png

运维整个大数据分析平台非常复杂,需要专业的人才和大量的投入。从基础运维到管理运维,再到组件运维,云厂商提供了多维度运维能力。

基础运维:云厂商借助自身大规模服务器运维经验构建 AlOps 系统,可以提前对硬件做检测分析、发现故障后快速进行主动运维,减少对业务的影响。

管理运维:EMR 实现一键部署、开箱即用,还提供统一的配置管理、平台状态监控和故障报警等功能。

组件运维:组件运维是大数据分析平台最复杂的部分,当进行版本升级时,由于组件之间存在着千丝万缕的关联,保证兼容是重中之重。

组件运维还有一个很重要的点就是性能优化,云厂商会结合自身云计算优势对底层基础设施进行优化,对内核引擎进行优化,帮助开源组件提升性能。

云托管之云生态

云上有丰富的生态,避免后来者重复造轮子或从零开始,如下图:

底层存储在云上可以提供 OSS 对象存储、HDFS 存储,HDFS 存储可以直接去无缝访问 OSS 对象存储,与访问 HDFS 文件没有任何差别,这样一来,就可以灵活的进行数据归档和成本调优。

在数据源方面, 支持 OSS、SLS、RDS、消息队列等服务作为数据源;在计算引擎方面,云上 EMR 平台可与 MaxCompute、Flink、Tensorflow 引擎进行打通。

在融合方面,云上提供 DataWorks 服务,通过 DataWorks 可以把 Hadoop 整个上层元数据的管理、数据质量管理进行统一。

除此之外,云上还提供 DataV、QuickBI 等分析展示能力。

除以上概述内容外,后续还有云服务和云原生等方面更多干货,请戳视频进行观看


阿里巴巴开源大数据技术团队成立Apache Spark中国技术社区,定期推送精彩案例,技术专家直播,问答区数个Spark技术同学每日在线答疑,只为营造纯粹的Spark氛围,欢迎钉钉扫码加入!
image.png

相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
14天前
|
存储 消息中间件 监控
【Flume】Flume在大数据分析领域的应用
【4月更文挑战第4天】【Flume】Flume在大数据分析领域的应用
|
18天前
|
存储 大数据 数据处理
PHP 与大数据:构建高效数据处理系统
传统的数据处理系统往往难以应对大规模数据的处理需求,而PHP作为一种常用的服务器端脚本语言,在数据处理方面也有其独特的优势。本文将探讨如何利用PHP构建高效的大数据处理系统,结合实际案例分析其应用场景及优势所在。
15 2
|
27天前
|
Cloud Native 数据处理 云计算
探索云原生技术在大数据分析中的应用
随着云计算技术的不断发展,云原生架构作为一种全新的软件开发和部署模式,正逐渐引起企业的广泛关注。本文将探讨云原生技术在大数据分析领域的应用,介绍其优势与挑战,并探讨如何利用云原生技术提升大数据分析的效率和可靠性。
|
1月前
|
存储 消息中间件 大数据
Go语言在大数据处理中的实际应用与案例分析
【2月更文挑战第22天】本文深入探讨了Go语言在大数据处理中的实际应用,通过案例分析展示了Go语言在处理大数据时的优势和实践效果。文章首先介绍了大数据处理的挑战与需求,然后详细分析了Go语言在大数据处理中的适用性和核心技术,最后通过具体案例展示了Go语言在大数据处理中的实际应用。
|
1月前
|
数据采集 运维 数据挖掘
API电商接口大数据分析与数据挖掘 (商品详情店铺)
API接口、数据分析以及数据挖掘在商品详情和店铺相关的应用中,各自扮演着重要的角色。以下是关于它们各自的功能以及如何在商品详情和店铺分析中协同工作的简要说明。
|
8天前
|
机器学习/深度学习 人工智能 安全
Azure Databricks实战:在云上轻松进行大数据分析与AI开发
【4月更文挑战第8天】Databricks在大数据分析和AI开发中表现出色,简化流程并提高效率。文中列举了三个应用场景:数据湖分析、实时流处理和AI机器学习,并阐述了Databricks的一体化平台、云原生弹性及企业级安全优势。博主认为,Databricks提升了研发效能,无缝集成Azure生态,并具有持续创新潜力,是应对大数据挑战和加速AI创新的理想工具。
31 0
|
9天前
|
SQL 分布式计算 Hadoop
利用Hive与Hadoop构建大数据仓库:从零到一
【4月更文挑战第7天】本文介绍了如何使用Apache Hive与Hadoop构建大数据仓库。Hadoop的HDFS和YARN提供分布式存储和资源管理,而Hive作为基于Hadoop的数据仓库系统,通过HiveQL简化大数据查询。构建过程包括设置Hadoop集群、安装配置Hive、数据导入与管理、查询分析以及ETL与调度。大数据仓库的应用场景包括海量数据存储、离线分析、数据服务化和数据湖构建,为企业决策和创新提供支持。
40 1
|
21天前
|
机器学习/深度学习 人工智能 数据可视化
基于Python的数据可视化技术在大数据分析中的应用
传统的大数据分析往往注重数据处理和计算,然而数据可视化作为一种重要的技术手段,在大数据分析中扮演着至关重要的角色。本文将介绍如何利用Python语言中丰富的数据可视化工具,结合大数据分析,实现更直观、高效的数据展示与分析。
|
28天前
|
存储 NoSQL 大数据
新型数据库技术在大数据分析中的应用与优势探究
随着大数据时代的到来,传统数据库技术已经无法满足海量数据处理的需求。本文将探讨新型数据库技术在大数据分析中的应用情况及其所带来的优势,为读者解析数据库领域的最新发展趋势。
|
1月前
|
SQL 存储 监控
构建端到端的开源现代数据平台
构建端到端的开源现代数据平台
49 4