大数据是什么软件-大数据是什么软件文档介绍内容-移动阿里云

应用场景

实时数据通道接入多种异构数据并投递到下游多种大数据系统通过数据总线，您可以实时接入APP、WEB、IoT和数据库等产生的异构数据，统一管理，并投递到下游的分析、归档等系统，构建清晰的数据流，让您更好的释放数据的价值。收益系统解耦...

IoT数据自动化同步至云端解决方案

大数据分析是大数据完成数据价值化的重要手段之一，而进行大数据分析的第一步是让数据成功上云。解决方案 IoT数据自动化同步至云端解决方案主要包括存储原始数据和同步数据至分析系统两部分。IoT设备大量的数据通常以半结构化的形式存储。...

产品简介

什么是数据安全中心 DSC（Data Security Center）（敏感数据保护）DSC 可根据预先定义的敏感数据关键字段，扫描MaxCompute、OSS、阿里云数据库服务（RDS、PolarDB-X、PolarDB、OceanBase、表格存储）、自建数据库等数据库中的数据，通过...

数据迁移与同步FAQ

DTS的数据迁移与数据同步工作原理是什么？DTS的数据迁移与数据同步有什么区别？使用DTS遇到预检查报错，如何解决？什么是数据迁移、数据同步？数据迁移：将 Tair 或 Redis开源版的数据（即键值对）迁移至另一个 Tair 或 Redis开源版中。...

DataV数字大屏设计介绍

本文主要介绍数字大屏的设计风格和搭建思路，以及在设计数字大屏时遇到的常见问题和解决办法。设计风格独特清晰的风格赋予数字大屏独特的行业属性，在数字大屏设计中经常会出现需求方要求设计炫酷的要求，其中炫酷包含的关键词主要有科技...

COS数据源

不写 nullFormat 这个参数，等同于“未配置”，代表来源是什么数据就直接按照什么数据写入目标端，不作任何转换。否无 skipHeader CSV格式文件通过 skipHeader 配置是否读取表头内容。True：同步数据源的时候读取表头内容。False：同步...

DeltaLake

Delta Lake以数据为中心，围绕数据流走向（数据从流入数据湖、数据组织管理和数据查询到流出数据湖）推出了一系列功能特性，协助您搭配第三方上下游工具，搭建快捷、易用和安全的数据湖。背景信息通常的数据湖方案是选取大数据存储引擎...

分析业务过程

对业务过程进行分解，了解过程中的每一个环节会产生哪些数据，数据的内容是什么。数据在什么情况下会更新，更新的逻辑是什么。业务过程可以是单个业务事件，例如交易的支付、退款等；也可以是某个事件的状态，例如当前的账户余额等；还可以...

分析业务过程

对业务过程进行分解，了解过程中的每一个环节会产生哪些数据，数据的内容是什么。数据在什么情况下会更新，更新的逻辑是什么。业务过程可以是单个业务事件，例如交易的支付、退款等；也可以是某个事件的状态，例如当前的账户余额等；还可以...

大数据专家服务

大数据专家服务（Bigdata Expert Service）是由阿里云大数据专家基于阿里云多年大数据架构、应用、运维、AI算法建模等最佳实践经验及方法论为用户提供全方位的大数据产品技术、咨询服务及售后专家服务运维保障，帮助用户构建和持续优化的大...

数据源权限管理

本文为您汇总数据源权限管理相关的问题。哪些角色可以管理数据源的权限？是否支持再次分享已被分享的数据源？数据源的创建者是否有权控制该数据源？什么是私有模式的数据源？哪些用户能够收回数据源的分享权限？如何检查数据源分享关系的...

常见问题

数据安全中心对于结构化数据源的扫描机制是什么样的？数据安全中心扫描数据源中的字段名称、字段值综合判断该数据是否为敏感数据，只通过字段值无法判断数据是否敏感。例如：年龄数据。敏感数据识别是如何实现的？敏感数据识别是在完成数据...

实时同步任务延迟解决方案

用于帮助您判断数据同步延迟的瓶颈方，当数据同步发生延迟时，指标数据较大的一般为瓶颈方。确认造成延迟问题的系统是否有异常当确认了延迟瓶颈是在同步任务的读端还是写端后，可在上述任务运行详情中切换至日志页签，使用 Error/error/...

数据洞察

DataWorks数据洞察是指通过深度数据分析和解读来获取深刻的数据理解和发现，支持数据探索和可视化。通过数据洞察了解数据分布，创建数据卡片，并组合成数据报告。此外，数据洞察结果能够通过长图形式的报告进一步分享。该功能利用AI技术...

独享资源组

独享资源组使用场景独享调度资源组使用场景独享数据集成资源组使用场景独享资源组网络配置独享资源组访问VPC环境下数据的前提条件是什么？如何查看数据源的网络环境？添加独享资源组白名单独享资源组商业化行为如何对资源组进行续费...

为什么会空跑

什么是空跑？为什么会空跑？场景一：周月实例空跑周期场景二：实时生成的过期实例场景三：设置成功实例场景四：实例属性为空跑场景五：临时工作流中未被选择的实例日调度任务空跑排查方法什么是空跑？空跑的实例任务状态显示成功...

组件操作

EMR提供的组件包括开源和自研两大类，涵盖数据开发、计算引擎、数据服务、资源管理、数据存储、数据集成等领域，您可以按需选择和配置。说明在创建集群时，如果没有您想使用的组件，或者想使用的开源组件仅对存量用户开放，您可以自行安装...

配置FTP输入组件

FTP输入组件适用于从FTP中将数据读取至大数据平台对接的存储系统内，进行数据整合和再加工。本文为您介绍如何配置FTP输入组件。前提条件已创建FTP数据源，详情请参见创建FTP数据源。进行FTP输入组件属性配置的账号，需具备该数据源的同步...

配置FTP输入组件

FTP输入组件适用于从FTP中将数据读取至大数据平台对接的存储系统内，进行数据整合和再加工。本文为您介绍如何配置FTP输入组件。前提条件已创建FTP数据源，详情请参见创建FTP数据源。进行FTP输入组件属性配置的账号，需具备该数据源的同步...

数据目录

StarRocks自2.3版本起支持Catalog（数据目录）功能，实现在一套系统内同时维护内、外部数据，方便您轻松访问并查询存储在各类外部源的数据。本文为您介绍什么是Catalog，以及如何使用Catalog管理和查询内外部数据。基本概念内部数据：...

内表数据源

本文为您介绍什么是内表数据源（Default Catalog），以及如何使用Default Catalog查询StarRocks内部数据。Default Catalog StarRocks 2.3及以上版本提供了Internal Catalog（内部数据目录），用于管理StarRocks的内部数据。每个StarRocks...

数据分析

本文为您介绍什么是Catalog（数据目录），以及如何使用Catalog管理和查询内外部数据。基本概念内部数据：保存在StarRocks中的数据。外部数据：保存在外部数据源（例如Apache Hive、Apache Iceberg和Apache Hudi）中的数据。Catalog ...

异构数据源访问

若您需要通过 AnalyticDB PostgreSQL版访问外部异构数据源（HDFS、Hive和JDBC）时，可以使用异构数据源访问功能将外部数据转换为 AnalyticDB PostgreSQL版数据库优化后的格式进行查询和分析。功能说明外部数据源管理提供高性能的结构化...

准备环境

本教程以用户画像为例，在华东2（上海）地域演示如何使用DataWorks完成数据同步、数据加工和质量监控的全流程操作。为了确保您能够顺利完成本教程，您需要准备教程所需的EMR Serverless StarRocks集群、DataWorks工作空间，并进行相关的...

云消息队列 Kafka 版数据迁移至MaxCompute

本文介绍如何使用DataWorks数据同步功能，将云消息队列 Kafka 版集群上的数据迁移至阿里云大数据计算服务MaxCompute，便于分析加工离线数据。前提条件在开始本教程前，确保您在同一地域中已完成以下操作：云消息队列 Kafka 版购买并...

产品简介

大数据专家服务 大数据专家服务（Bigdata Expert Service）是由阿里云大数据专家基于阿里云多年大数据架构、应用、运维、AI算法建模等最佳实践经验及方法论为用户提供全方位的大数据产品技术、咨询服务及售后专家服务运维保障，帮助用户...

整体架构

云原生数据仓库 AnalyticDB MySQL 版是阿里巴巴自主研发、经过超大规模以及核心业务验证的PB级实时数据仓库。概述自2012年第一次在集团发布上线以来，AnalyticDB for MySQL 至今已累计迭代发布近百个版本，支撑起集团内的电商、广告、...

数据质量

典型工作流程如下：功能介绍 DataWorks 数据质量支持对常见大数据存储（MaxCompute、E-MapReduce、Hologres、AnalyticDB 等）进行质量校验，从完整性、准确性、一致性等多个维度配置监控规则，并与调度任务关联，实现自动化校验与问题告警...

创建Greenplum数据源

通过创建Greenplum数据源能够实现Dataphin读取Greenplum的业务数据或向Greenplum写入数据。本文为您介绍如何创建Greenplum数据源。背景信息 Greenplum是一款大数据分析引擎，适用于分析、机器学习和AI等领域。其架构主要针对管理大规模分析...

创建Greenplum数据源

通过创建Greenplum数据源能够实现Dataphin读取Greenplum的业务数据或向Greenplum写入数据。本文为您介绍如何创建Greenplum数据源。背景信息 Greenplum是一款大数据分析引擎，适用于分析、机器学习和AI等领域。其架构主要针对管理大规模分析...

Append Delta Table数据组织优化

要求数据必须以插入或覆写数据（INSERT INTO|INSERT OVERWRITE）的形式一次性写入，在写入完成后，如果需要再进一步追加数据，则需要将表中原有的数据全部读取，与新增数据并集（UNION）之后再次写入，数据追加代价非常大，效率很低。...

大数据开发治理平台 DataWorks

大数据开发治理平台 DataWorks基于MaxCompute/EMR/Hologres等大数据计算引擎，为客户提供专业高效、安全可靠的一站式大数据开发与治理平台，自带阿里巴巴数据中台与数据治理最佳实践，赋能各行业数字化转型。每天阿里巴巴集团内部有数万名...

创建Teradata数据源

参数描述数据源名称命名规则如下：只能包含中文、英文字母大小写、数字、下划线（_）或短划线（-）。长度不能超过64字符。数据源编码配置数据源编码后，您可以在Flink_SQL任务中通过数据源编码.表名称或数据源编码.schema.表名称的...

基于MaxCompute进行大数据BI分析

背景信息 MaxCompute：用于进行大规模数据计算，详情请参见什么是MaxCompute。AnalyticDB MySQL：用于进行海量数据实时高并发在线分析，详情请参见云原生数据仓库AnalyticDB MySQL版。DataWorks：可实现ETL功能，对复杂数据集进行采集、...

创建Teradata数据源

参数描述数据源名称命名规则如下：只能包含中文、英文字母大小写、数字、下划线（_）或短划线（-）。长度不能超过64字符。数据源编码配置数据源编码后，您可以在Flink_SQL任务中通过数据源编码.表名称或数据源编码.schema.表名称的...

功能特性

数据迁移数据迁移功能帮助您实现同构或异构数据源之间的数据迁移，适用于数据上云迁移、阿里云内部跨实例数据迁移、数据库拆分扩容等业务场景。功能集功能功能描述参考文档同构迁移逻辑迁移支持同构数据库间的数据迁移。自建MySQL...

实时同步常见问题

写端延迟大目标数据库性能、负载等问题当数据库负载较高时，单一的调整同步任务并发并不能解决问题，您需要联系数据库管理员寻求相关帮助。读写端延迟大使用公网同步，网络问题导致同步任务延迟。公网同步无法保障实时同步时效性，建议...

节点开发

DataWorks的Data Studio模块提供多种节点以满足不同数据处理需求：数据集成节点用于同步，引擎计算节点（如MaxCompute SQL、Hologres SQL、EMR Hive）用于数据清洗，通用节点（如虚拟节点和do-while循环节点）用于复杂逻辑处理。...

创建Hudi数据源

参数描述数据源名称命名规则如下：只能包含中文、英文字母大小写、数字、下划线（_）或短划线（-）。长度不能超过64字符。数据源编码配置数据源编码后，您可以在Flink_SQL任务中通过数据源编码.表名称或数据源编码.schema.表名称的...

创建Hudi数据源

参数描述数据源名称命名规则如下：只能包含中文、英文字母大小写、数字、下划线（_）或短划线（-）。长度不能超过64字符。数据源编码配置数据源编码后，您可以在Flink_SQL任务中通过数据源编码.表名称或数据源编码.schema.表名称的...