深入剖析 Delta Lake:Schema Enforcement & Evolution

阿里云E-MapReduce团队 2020-04-07

spark aliyun 开源大数据 DataFrame string schema 存储 数据类型

编译:辰山,阿里巴巴计算平台事业部 EMR 高级开发工程师,目前从事大数据存储方面的开发和优化工作


在实践经验中,我们知道数据总是在不断演变和增长,我们对于这个世界的心智模型必须要适应新的数据,甚至要应对我们从前未知的知识维度。表的 schema 其实和这种心智模型并没什么不同,需要定义如何对新的信息进行分类和处理。

这就涉及到 schema 管理的问题,随着业务问题和需求的不断演进,数据结构也会不断发生变化。通过 Delta Lake,能够很容易包含数据变化所带来的新的维度,用户能够通过简单的语义来控制表的 schema。相关工具主要包括 Schema 约束(Schema Enforcement)和 Schema 演变(Schema Evolution),前者用以防止用户脏数据意外污染表,后者用以自动添加适当的新数据列。本文将详细剖



登录 后评论
下一篇
云栖号资讯小编
2449人浏览
2020-05-25
相关推荐
Tablestore+Delta Lake(快速开始)
6814人浏览
2019-09-26 11:55:49
Delta元数据解析
568人浏览
2019-12-02 14:13:59
0
1
0
378