内含福利|阿里云数据库再获学术顶会认可,一文全览VLDB最新亮点

本文涉及的产品
云原生数据库 PolarDB MySQL 版,Serverless 5000PCU 100GB
云数据库 Redis 版,社区版 2GB
推荐场景:
搭建游戏排行榜
云数据库 RDS MySQL Serverless,0.5-2RCU 50GB
简介: 一年一度的数据库领域顶级会议VLDB 2019于当地时间8月26日-8月30日在洛杉矶圆满落幕。在本届大会上,阿里云数据库产品团队浓墨登场,不仅有多篇论文入选Research Track和Industrial Track,为了进一步加深产学研学术交流,阿里云还在大会期间举办了“阿里之夜”交流

一年一度的数据库领域顶级会议VLDB 2019于当地时间8月26日-8月30日在洛杉矶圆满落幕。在本届大会上,阿里云数据库产品团队浓墨登场,不仅有多篇论文入选Research Track和Industrial Track,为了进一步加深产学研学术交流,阿里云还在大会期间举办了“阿里之夜”交流晚宴。

0001.jpg
0002.jpg

8月29日晚,超200名论文作者、行业专家、来自MIT、CMU等高校的学术界资深教授、学者和产业界人士共赴“阿里之夜——Alibaba Night Networking Event“,活动空前爆满。在轻松氛围中,参会者共同探讨全球数据库生态,并就阿里云目前在数据库和大数据方面的最新技术进展进行交流与研讨,开启了一场智慧碰撞的盛宴。

99999.JPG

在VLDB大会上,阿里巴巴集团副总裁、阿里云数据库事业部总裁、达摩院数据库首席科学家李飞飞进行题为《Cloud Native Database System at Alibaba: Opportunities and Challenges》的主题演讲。李飞飞分享了云原生数据库在阿里发展的心路历程,并表示:“云原生数据库天然拥有云计算的弹性能力,不仅具备开源数据库的易用、开放特点,而且拥有传统数据库的管理和处理性能等优势“。

他还详细介绍了阿里云自研数据库的两款明星产品:OLTP数据库——POLARDB基于共享存储的Scale-up 架构和基于分片的scale-out分布式架构,以及OLAP数据库——AnalyticDB的MPP架构、极具特色的全索引和行列混存结构,以及在海量数据场景下极致性能。

领跑数据时代 技术实力再获权威认可

VLDB大会全称International Conference on Very Large Data Bases,是数据库及相关领域研究者、供应商、参与者、应用开发者所广泛关注的主要国际学术会议,也是公认的数据库领域三大顶级会议 (SIGMOD、VLDB、ICDE) 之一,反映了当前数据库研究的前沿方向、工业界的最新技术以及各国的研发水平。在发表论文难度和受关注程度上,与SIGMOD可谓并驾齐驱。

根据大会官方公布,今年VLDB共接收了128篇Research Paper、22篇Industrial Paper和48个Demo。从投稿数量与录用率来看,Research Paper投稿677篇,录用率18.9%,Industry Paper为72/30.6%,**只有具有极高创新性的论文才有机会被VLDB录用。
**
作为阿里巴巴IT基础设施的重要组成部分,阿里云数据库在工程实践和技术创新上一直走在领域前列,相关研究成果已多次入选国际数据库顶级会议(SIGMOD、VLDB、ICDE等)。本次VLDB大会,阿里云数据库共有3篇论文被收录,下面小编将对入选的论文佳作进行汇总赏析,萃取精华之精华,以飨读者。

No.1

论文题目:《S3: A Scalable In-memory Skip-List Index for Key-Value Store》

亮点:阿里云携手浙江大学的最新联合研究成果入选Industrial Track

作者:浙江大学Jingtian Zhang、Sai Wu、Zeyuan Tan、Gang Chen,阿里云数据库产品事业部成柱石、曹伟、高玉嵩、酆晓杰

附送论文下载链接:http://www.vldb.org/pvldb/vol12/p2183-zhang.pdf

或关注 “阿里巴巴数据库技术”公众号,回复“VLDB”,即可获取论文PDF

本文贡献

  1. 针对 Skip List 这种被广泛使用的索引结构,对其在高并发场景下的性能表现进行了详实的测试验证,建立数据模型分析在垂直下降和水平移动两个不同方向上的 cost-model,确立 Skip List 在当前实现下的性能上限。
  2. 基于上述模型分析,设计实现了 S3:A Scalable In-memory Skip-List Index,通过分层的方法把整个结构分为两部分:Top layer 利用 cache-sensitive 的数据结构来索引 bottom layer 的部分节点(guard entries),以大幅降低现有 Skip-List 在垂直下降过程中的性能损耗;Bottom layer 维护一个低层高的 Semi-ordered Skip-List,由多个 guard entries 分隔开,各 entries 之间有序、内部无序,以进一步提升其在插入方面的优势。
  3. 考虑到 guard entryies 选择的非确定性,结合实际场景中业务 workload 变化比较平滑,引入 Neural Model 来指导其selection,以达到更优的优化效果。

VLDB评委点评

“Many previous in-memory indexes, although showing significantly better performance than skip-list, have not been integrated with the real systems and thus, there is no clue about how they will work with other system modules. S3, on the other hand, can be easily integrated with the disk part of RocksDB and LevelDB, because it maintains the same interface.

The top layer is cache-oblivious, while the bottom layer can speed up the lookup operations of skip-list.

It’s an interesting idea to use a neural model, LSTM, to tune the index, i.e., optimizing guard entry selection and using some rules to optimize multi-thread access.

Extensive experiments for comparison of the proposed method with different in-memory indexes have been conducted and the result shows benefit, not to mention that it is implemented in a real system RocksDB.”

No.2

论文题目:《iBTune: Individualized Buffer Tuning for Large-scale Cloud Databases》

亮点:阿里巴巴在数据库智能化方向的重要里程碑,入选Research Track

作者:阿里云谭剑、铁赢、飞刀、艾奥、祺星、池院、洪林、石悦、鸣嵩、张瑞

附送论文下载链接:http://www.vldb.org/pvldb/vol12/p1221-tan.pdf
或关注 “阿里巴巴数据库技术”公众号,回复“VLDB”,即可获取论文PDF

本文贡献

基于数据驱动和机器学习算法的数据库参数优化是近年来数据库智能优化的一个热点方向,但也面临着很大的技术挑战。要解决的问题是在大规模数据库场景下,如何对百万级别运行不同业务的数据库实例完成自动配置,同时权衡性能和成本,在满足SLA的前提下资源成本最低,该技术对于CSP(Cloud Service Provider)有重要价值。

学术界近一两年在该方向有一些研究(比如CMU的OtterTune),但该算法依赖于一些人工先验经验且在大规模场景下不具备可扩展性。据了解, 其他云厂商Azure SQL Database以及AWS该方向都有投入,目前尚未看到相关论文或产品发布。

从18年初开始,阿里云开始数据库智能参数优化的探索,从问题定义,关键算法设计,算法评估及改进,到最终端到端自动化流程落地,多个团队通力合作完成了技术突破且实现了大规模落地。

这项工作不仅在数据库智能参数优化理论方面提出了创新想法,而且目前已经在阿里集团~10000实例上实现了规模化落地,累计节省~12%内存资源,是目前业界唯一一家真正实现数据库智能参数优化大规模落地的公司。

经过算法探索和端到端自动Buffer Pool优化流程建设,FY2019集团内全网最终优化 ~10000 个实例,将整体内存使用量从 217T内存缩减到 190T内存,节省 12.44%内存资源(27TB)。

论文深度解读请戳⬇️:

[前沿 | VLDB 2019论文解读:阿里巴巴大规模数据库智能参数优化的创新与实践
](https://mp.weixin.qq.com/s/KHHvr39lt2KL8FVFp9y25w)

VLDB评委点评

Lessons learned from tuning many database instances in a production system offer interesting insights to the data management community.

It is encouraging to see how deep neural networks can help with tuning a parameter of the database system and how its results are used by the control plane of a large scale deployment to tune many database instances in a rolling fashion.

No.3

论文题目:《AnalyticDB: Realtime OLAP Database System at Alibaba Cloud》

亮点:阿里云大规模、海量数据实时分析型数据库系统——AnalyticDB最新研究成果入选Industrial Track

作者:阿里云数据库产品事业部占超群、苏茂萌、魏闯先、彭晓强、林亮、汪晟、陈哲、李飞飞、潘岳、郑方、柴成亮

附送论文下载链接:http://www.vldb.org/pvldb/vol12/p2059-zhan.pdf
或关注 “阿里巴巴数据库技术”公众号,回复“VLDB”,即可获取论文PDF

本文贡献

已有的分析型数据库(以下简称OLAP)诸如Impala、Pinot、Druid等,总结了OLAP系统在设计的过程中应该解决的问题:低延迟、数据新鲜度、多样性、低成本、高扩展性、高可靠性。和这些已有的OLAP系统相比,AnalyticDB承载着更大的规模:2000+台物理机器、10PB+规模数据、百万张数据表以及万亿条数据行。

论文讲述了AnalyticDB如何在设计与实现上,不仅解决了已有OLAP系统的问题,还攻克了以下三大业界难题:

  • 1) 随着用户分析需求的急剧增加,用户的查询变得复杂且多样化:这些查询涵盖点查询、全表扫描、多表关联等,还会包含对任意列组合的筛选条件。如何在这种复杂分析场景下依然保证大部分甚至所有查询的低延迟,是一个非常大的挑战;
  • 2) 如何在保证低延迟查询的情况下,仍然能处理每秒千万级别的写吞吐。传统的设计理念在同一条链路上同时处理读写请求,这会造成读写性能的互相严重影响。
  • 3) 复杂分析场景下,会对行存、列存、关系型存储、复杂数据类型(JSON、vector、text)都有着强烈需求。如何设计一个对这些存储格式都很友好的存储层,也是一个业界难题。

深度解读请戳⬇️:

前沿 | VLDB论文解读:阿里云超大规模实时分析型数据库AnalyticDB

VLDB评委点评

This paper presents a solid OLAP database integrating a few interesting and well-designed ideas including an asynchronous all-column index, an extended hybrid row-column layout and a read/write decoupling architecture. The presentation is clear and the solution has been shown to be effective empirically.

The combination of different design choices indicate that the system achieves significant performance improvements over other similar systems.

相关实践学习
数据库实验室挑战任务-初级任务
本场景介绍如何开通属于你的免费云数据库,在RDS-MySQL中完成对学生成绩的详情查询,执行指定类型SQL。
阿里云云原生数据仓库AnalyticDB MySQL版 使用教程
云原生数据仓库AnalyticDB MySQL版是一种支持高并发低延时查询的新一代云原生数据仓库,高度兼容MySQL协议以及SQL:92、SQL:99、SQL:2003标准,可以对海量数据进行即时的多维分析透视和业务探索,快速构建企业云上数据仓库。 了解产品 https://www.aliyun.com/product/ApsaraDB/ads
目录
相关文章
|
27天前
|
关系型数据库 分布式数据库 数据库
成都晨云信息技术完成阿里云PolarDB数据库产品生态集成认证
近日,成都晨云信息技术有限责任公司(以下简称晨云信息)与阿里云PolarDB PostgreSQL版数据库产品展开产品集成认证。测试结果表明,晨云信息旗下晨云-站群管理系统(V1.0)与阿里云以下产品:开源云原生数据库PolarDB PostgreSQL版(V11),完全满足产品兼容认证要求,兼容性良好,系统运行稳定。
|
1月前
|
缓存 安全 Java
阿里云数据库 SelectDB 内核 Apache Doris 2.0.6 版本正式发布
阿里云数据库 SelectDB 内核 Apache Doris 2.0.6 版本正式发布
|
1月前
|
存储 NoSQL 数据库
阿里云数据库Cassandra的产品价格
阿里云数据库Cassandra提供多地域服务,如中国、亚太、欧洲、美洲及中东。计费分为实例主机节点规格费和存储费用,实例价格因节点数和副本数而异,存储费用按挂载云盘计算。生产系统建议配置多节点以确保冗余。公网流量目前免费,具体收费时间未定。详细价格以购买页面为准。
421 3
|
1月前
|
SQL 关系型数据库 MySQL
2024年阿里云数据库创建_数据库账号密码和连接教程
阿里云数据库怎么使用?阿里云百科整理阿里云数据库从购买到使用全流程,阿里云支持MySQL、SQL Server、PostgreSQL和MariaDB等数据库引擎,阿里云数据库具有高可用、高容灾特性,阿里云提供数据库备份、恢复、迁移全套解决方案。详细阿里云数据库购买和使用流程方法如下
|
1月前
|
SQL 安全 数据管理
在阿里云数据管理DMS(Data Management Service)中,您可以按照以下步骤来创建和管理数据库
【2月更文挑战第33天】在阿里云数据管理DMS(Data Management Service)中,您可以按照以下步骤来创建和管理数据库
36 7
|
1月前
|
SQL 关系型数据库 MySQL
阿里云MySQL数据库价格、购买、创建账号密码和连接数据库教程
阿里云数据库使用指南:购买MySQL、SQL Server等RDS实例,选择配置和地区,完成支付。创建数据库和账号,设置权限。通过DMS登录数据库,使用账号密码访问。同地域VPC内的ECS需将IP加入白名单以实现内网连接。参考链接提供详细步骤。
369 3
|
21天前
|
弹性计算 关系型数据库 MySQL
阿里云数据库服务器价格表,数据库创建、连接和使用教程
阿里云数据库使用流程包括购买和管理。选择所需数据库类型如MySQL,完成实名认证后购买,配置CPU、内存和存储。确保数据库地域与ECS相同以允许内网连接。创建数据库和账号,设置权限。通过DMS登录数据库,使用账号密码连接。同一VPC内的ECS需添加至白名单以进行内网通信。参考官方文档进行详细操作。
123 3
|
1月前
|
弹性计算 关系型数据库 MySQL
阿里云MySQL云数据库优惠价格、购买和使用教程分享!
阿里云数据库使用流程包括购买和管理。首先,选购支持MySQL、SQL Server、PostgreSQL等的RDS实例,如选择2核2GB的MySQL,设定地域和可用区。购买后,等待实例创建。接着,创建数据库和账号,设置DB名称、字符集及账号权限。最后,通过DMS登录数据库,填写账号和密码。若ECS在同一地域和VPC内,可内网连接,记得将ECS IP加入白名单。
435 2
|
1月前
|
存储 SQL 数据管理
阿里云数据库 SelectDB 内核 Apache Doris 如何基于自增列满足高效字典编码等典型场景需求|Deep Dive 系列
自增列的实现,使得 Apache Doris 可以在处理大规模时展示出更高的稳定性和可靠性。通过自增列,用户能够高效进行字典编码,显著提升了字符串精确去重以及查询的性能。使用自增列作为主键来存储明细数据,可以完美的解决明细数据更新的问题。同时,基于自增列,用户可以实现高效的分页机制,轻松应对深分页场景,有效过滤掉大量非必需数据,从而减轻数据库的负载压力,为用户带来了更加流畅和高效的数据处理体验。
|
1月前
|
SQL 关系型数据库 MySQL
阿里云mysql数据库价格购买和使用教程
阿里云数据库使用指南:购买MySQL、SQL Server等RDS实例,通过选择配置、地域和可用区完成购买。创建数据库和账号,分配权限。使用DMS登录数据库,进行管理操作。确保ECS与RDS在同一地域的VPC内,配置白名单实现内网连接。详细步骤见官方文档。
631 1