研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 招商证券-计算机行业大数据系列(二):数据仓库深度分析,从Snowflake快速崛起深度解析数仓竞争要素-230922
上传日期:   2023/9/23 大小:   2615KB
格式:   pdf  共39页 来源:   招商证券
评级:   -- 作者:   刘玉萍
行业名称:   计算机
下载权限:   此报告为加密报告
数据仓库因数据分析需求涌现而诞生,作为大数据分析的承载底座,将在数字经济发展中扮演重要角色。本篇报告是我们大数据专题系列第二篇,我们从技术架构、OLAP分类、数据模型、数仓架构演化、新一代云原生数仓发展等多方面对数仓发展进行了详细解析;并深度挖掘了Snowflake快速崛起背后的核心竞争力与成长潜力,对大数据产业链分析与相关企业筛选起到借鉴意义。
  分析型数据仓库因数据分析需求涌现而诞生,将受益于BI需求持续增长。随着企业对数据价值挖掘需求的涌现,传统OLTP事务型数据库存在部门间数据难以打通的问题,产生数据孤岛,为挖掘数据价值带来阻碍。数据仓库能够实现多源数据汇集,以及能够通过数据分层实现解耦合,在不占用业务资源的同时,使其作为BI的技术底座,满足客户的数据分析和决策支持。根据Gartner,全球现代BI及分析工具市场预计将从20年起以CAGR为16%的增速增长至26年的130亿美元,实现规模翻倍;根据Modor Intelligence,全球数仓规模将与BI需求增长保持一致,2023年全球数仓规模约为90.1亿美元,预计2028年将达到152.5亿美元,2023-2028年复合增长率为11.10%。
  数仓市场海外新老玩家角逐激烈,国内云厂商占据主导。海外市场,Microsoft、Amazon、Google等云计算龙头与自身完善的云生态结合,凭借多产品协同效应持续在数仓赛道发力;Oracle、IBM等老牌关系型数据库龙头,凭借与自身数据库深度结合,在数据仓库方面也保持一定份额。以Snowflake为代表的新兴厂商凭借其中立身份、多云支持、算储分离的创新架构带来的弹性收费模式等优势,快速抢占份额,与龙头企业形成竞争与合作并存的发展逻辑。国内市场,对大数据平台需求较高的行业主要包括政府、金融、运营商、互联网等行业,华为、阿里等云厂商凭借在政企、互联网等行业优势,占据主要份额。
  他山之石:我们对新型云原生数仓企业Snowflake快速发展进行深度分析,发掘数仓行业竞争要素。通过对Snowflake的全面分析,我们认为其核心优势包括:1)Snowflake创新型算储分离架构,使得资源分配更加合理。2)改变传统预先设定规模的模式,算储分离的弹性计费进一步降低使用门槛。3)作为中立的第三方平台,提供多云支持更易受客户青睐。
  未来数仓逐步向上层BI应用融合与开辟数据交易市场,成为提升数仓产品价值重要增量方向:1)以数仓为核,向BI融合:数据仓库作为BI的技术底座,Snowflake可在高标准化的数据仓库基础上开发直接面向客户、实现数据可视化功能的前端应用,逐步向上层BI拓展,有助于进一步提升数仓产品商业价值。2)数据交易提供业务增量:Snowflake的数据分享功能孕育数据交易市场Marketplace,目前已有448家数据供应商,公司凭借其中立第三方身份,提供跨云数据整合支持,同时交易的数据可在Snowflake平台上直接应用存储和计算资源,最终强化其核心业务变现能力。3)紧抓AIGC机遇,以数仓助力构建大模型。
  风险提示:技术创新不及预期,数仓行业竞争加剧,大数据发展不及预期影响数仓行业发展,被数据库、数据湖替代风险
研究报告全文:证券研究报告行业深度报告2023年09月22日从Snowflake快速崛起深度解析数仓竞争要素推荐维持大数据系列二数据仓库深度分析TMT及中小盘计算机数据仓库因数据分析需求涌现而诞生作为大数据分析的承载底座将在数字行业规模经济发展中扮演重要角色本篇报告是我们大数据专题系列第二篇我们从技占比股票家数只术架构OLAP分类数据模型数仓架构演化新一代云原生数仓发展等多27452总市值十亿元2761334方面对数仓发展进行了详细解析并深度挖掘了Snowflake快速崛起背后的核流通市值十亿元2264632心竞争力与成长潜力对大数据产业链分析与相关企业筛选起到借鉴意义行业指数分析型数据仓库因数据分析需求涌现而诞生将受益于BI需求持续增长随1m6m12m着企业对数据价值挖掘需求的涌现传统OLTP事务型数据库存在部门间数绝对表现-70-119278据难以打通的问题产生数据孤岛为挖掘数据价值带来阻碍数据仓库能相对表现-54-41337够实现多源数据汇集以及能够通过数据分层实现解耦合在不占用业务资计算机沪深30080源的同时使其作为BI的技术底座满足客户的数据分析和决策支持根据60Gartner全球现代BI及分析工具市场预计将从20年起以CAGR为16的40增速增长至26年的130亿美元实现规模翻倍根据ModorIntelligence20全球数仓规模将与BI需求增长保持一致2023年全球数仓规模约为901亿0美元预计2028年将达到1525亿美元2023-2028年复合增长率为1110-20Sep22Jan23May23Aug23数仓市场海外新老玩家角逐激烈国内云厂商占据主导海外市场Microsoft资料来源公司数据招商证券AmazonGoogle等云计算龙头与自身完善的云生态结合凭借多产品协同相关报告效应持续在数仓赛道发力等老牌关系型数据库龙头凭借与OracleIBM自身数据库深度结合在数据仓库方面也保持一定份额以Snowflake为代1数据资产评估产业展望计表的新兴厂商凭借其中立身份多云支持算储分离的创新架构带来的弹性算机行业周观察202309172023-09-17收费模式等优势快速抢占份额与龙头企业形成竞争与合作并存的发展逻2曙光已现华为计算产业生态辑国内市场对大数据平台需求较高的行业主要包括政府金融运营商加速发展华为产业链深度梳互联网等行业华为阿里等云厂商凭借在政企互联网等行业优势占据理2023-09-15主要份额3华为生态日渐完善关注产业他山之石我们对新型云原生数仓企业Snowflake快速发展进行深度分析链相关投资机会计算机行业周观察202309102023-09-10发掘数仓行业竞争要素通过对Snowflake的全面分析我们认为其核心优4筚路蓝缕星火燎原大数势包括1Snowflake创新型算储分离架构使得资源分配更加合理2据系列一数据库深度复盘与展改变传统预先设定规模的模式算储分离的弹性计费进一步降低使用门槛3望2022-02-25作为中立的第三方平台提供多云支持更易受客户青睐未来数仓逐步向上层BI应用融合与开辟数据交易市场成为提升数仓产品价刘玉萍S1090518120002值重要增量方向1以数仓为核向BI融合数据仓库作为BI的技术底座liuyupingcmschinacomcnSnowflake可在高标准化的数据仓库基础上开发直接面向客户实现数据可视化功能的前端应用逐步向上层BI拓展有助于进一步提升数仓产品商业价值2数据交易提供业务增量Snowflake的数据分享功能孕育数据交易市场Marketplace目前已有448家数据供应商公司凭借其中立第三方身份提供跨云数据整合支持同时交易的数据可在Snowflake平台上直接应用存储和计算资源最终强化其核心业务变现能力3紧抓AIGC机遇以数仓助力构建大模型风险提示技术创新不及预期数仓行业竞争加剧大数据发展不及预期影响数仓行业发展被数据库数据湖替代风险敬请阅读末页的重要说明行业深度报告正文目录一分析需求增长促数仓快速发展61分析需求涌现从数据库到数据仓库62数仓核心功能一多源数据汇集打破数据孤岛63数仓核心功能二通过数据分层解耦合实现业务与分析分离94实时分析需求快速增长从离线数仓到实时数仓105实时数仓架构演进从Lambda到Kappa从集中式到云原生11二国外市场新老玩家各具优势国内市场云厂商占据主导131数仓作为技术底座有望受益于BI需求增长132海外市场新老玩家角逐激烈同质化较高以分析能力与生态建设为重要发力方向143国内市场与海外厂商差距缩小云厂商占据主导19三颠覆传统数据仓库市场的Snowflake251从算储分离技术创新和业务创新看Snowflake崛起252以数仓为核心不断扩大功能边界263架构创新横跨三大公有云算储解耦264商业创新算储分离下实现单独弹性计费275成本优势Snowflake存储资源价格优势明显286财务与业务分析营收亮眼规模效应加强客户留存能力较强29四Snowflake核心竞争优势及发展启示高性能三方身份网络生态圈321高性能是数仓重要指标322专注于数仓的第三方身份更易受客户青睐323依托网络效应构筑生态护城河334增长看点一数据量爆发式增长下数仓需求快速增长345增长看点二以数仓为核向BI融合356增长看点三数据交易供增量强化平台变现能力367增长看点四与微软和英伟达合作共同构建AI大模型解决方案37风险提示38图表目录图1数据仓将多源数据聚合并进行价值挖掘7敬请阅读末页的重要说明2行业深度报告图2事实表与维度表示意图9图3星型模型与雪花模型示意图9图4常见的数据分层架构数据分层对数据进行层层加工10图5实时数仓分层架构图11图6Lambda架构vsKappa架构12图7Snowflake算储分离架构13图8数仓市场活跃度地图14图9全球数据仓库及BI市场规模亿美元14图10Snowflake前期客户数保持快速增长15图11AzureSynapse架构与Snowflake类似16图12MicrosoftAzure云数据生态系统成熟度高集数据存储分析可视化等功能于一体16图13AWSRedshift主架构采用MPP数据存储在计算节点中17图14GoogleBigQuery架构18图15IDC预计2021-2026年中国大数据市场规模将翻倍增长19图162023-2027年我国数据仓库软件市场规模预测19图17星环科技2016年进入Gartner数据仓库及数据管理解决方案魔力象限左图阿里腾讯2022年位列Gartner云数据库管理方案魔力象限中右图20图18我国数据仓库软件市场厂商份额本地部署模式2022H220图19我国数据仓库软件市场厂商份额公有云模式2022H220图20AnalyticDB架构21图21AnalyticDB在TPC-DS性能测试中排名第一21图22GaussDBDWS实时数据分析流程22图23华为云FusionInsight智能数据湖方案围绕数据周期建立22图24腾讯云数据仓库PostgreSQL架构未实现存算分离存储和计算都在Segment节点上进行23图25PostgreSQL应用场景之辅助经营分析决策23图26PostgreSQL应用场景之海量日志分析24图27公司技术框架从基于开源逐渐演进至高度自研25图28snowflake在3年内为客户创造612的ROI25图292021年Snowflake成功升级为云DBMS的领导者26图30Snowflake平台的演化从单一软件到生态系统的初步蜕变26敬请阅读末页的重要说明3行业深度报告图31Snowflake的平台部署在全球22个地区27图32Snowflake的云数据平台建立在三大公有云之上云原生架构中层级分明27图33Snowflake实现资源弹性计费28图34营收规模扩大产品收入贡献绝大部分营收30图35净利率毛利率稳步提升30图36第三方云服务成本占据高比例营业成本30图37计算机三费费率大体呈下降趋势30图38剩余履约合同RPO增速快收入增长可见度高30图39客户营收规模分布受大型企业及小规模营收企业青睐31图40Snowflake净收入留存率优异31图41Snowflake总客户数不断增长31图42大客户粘性持续增强31图43Snowflake命令执行时间标准差较小性能稳定32图44Gigaom部分测试结果Snowflake性能表现优异32图45企业的多云策略33图4655的企业表明使用2种公有云服务33图472020年2月-7月Snowflake账户之间的数据共享情况34图48Snowflake扩大生态合作伙伴圈34图49全球数据圈每年规模34图50企业成为数据使用的主要场合35图51Snowflake客户中营收小于100万美元的小规模客户比例较低35图52简化BI架构数据仓库是承上启下的中枢36图53Snowflake是数据与BI门户间的桥梁36图54目前SnowflakeMarketplace平台已经汇聚大量数据提供商37图55固定月费模式37图56按次收费模式37图57英伟达NeMO产品框架38表1数据库和数据仓库的比较6表2数据仓库架构设计7表3MOLAPROLAPHOLAP详解8敬请阅读末页的重要说明4行业深度报告表4传统业务数据库用于分析的痛点10表5数据分层优势解析10表6实时分析应用场景举例11表7数据仓库持续进化13表82017-2021Snowflake市场排名快速上升14表9数据仓库代表玩家发布产品的时间15表10云数据仓库海外代表产品同质化程度较高18表11Snowflake收费模式以消费为导向用多少付多少28表12Snowflake预留付费模式下的存储价格有相对优势28表13Snowflake客户覆盖领域广泛31敬请阅读末页的重要说明5行业深度报告一分析需求增长促数仓快速发展1分析需求涌现从数据库到数据仓库回顾数据库70年发展历程行业顺应需求变化持续演化根据我们大数据系列第一篇筚路蓝缕星火燎原大数据系列一数据库深度复盘与展望对数据库行业发展的详细梳理数据库的诞生可追溯至20世纪60年代其主要使命为存储查询及管理数据当前正处于以关系型数据库与非关系型数据库并行发展的时代关系型数据库占据主导地位在企业ERPCRM等核心业务领域被广泛应用非关系型数据库包括文档数据库图形数据库时序数据库等在金融反欺诈智能制造等特定应用场景具有很好的适配性随着企业对数据分析需求的涌现传统事务型数据库面临瓶颈数据仓库应运而生随着数据规模增长企业对数据价值挖掘需求快速增长传统模式下企业会根据业务需求将数据存储在不同的数据库中部门间数据隔阂难以打通产生数据孤岛为挖掘数据价值带来阻碍同时企业需通过分析大量数据以支持经营决策而主要面向事务处理的传统数据库其性能难以满足数据分析等进阶需求为从大量数据中获得洞察以支持企业决策数据仓库在此背景下诞生表1数据库和数据仓库的比较比较维度数据库数据仓库侧重于OLTP事务型处理针对具体业务通常对侧重于OLAP分析型处理一般针对某些主题的历史数据分记录进行查询修改OLTP重在事务处理主要面定义不同析OLAP重在分析处理主要对OLTP存储的数据进行后向交易过程强调实时性和稳定性常应用于EPR期分析以辅助决策CRMOA等业务系统目的不同存储捕获数据为分析数据支持决策而创建面向主题集成的主题指使用数仓进行决策时关心的重点面向事务操作型数据库各业务系统间存在隔离方面一个主题常与多个操作型数据库有关数据仓库是多面向对象不同通常与某些特定应用相关且是异构的个异构的数据源有效集成集成后按照主题进行重组保证数仓内信息是关于整个企业一致的全局信息数据关注的时间关注当下时间点存储瞬间数据关注历史时间段存储历史数据反映历史变化维度不同定期加载刷新数仓的数据所涉及操作主要是查询而修操作类型不同更新删除操作频繁数据通常实时更新改和删除操作很少通常只需定期的加载刷新资料来源javatpoint招商证券2数仓核心功能一多源数据汇集打破数据孤岛数据仓库有效打破原有数据孤岛建立集中存储机制企业往往会根据业务需求而存在多种数据库而数据库由于架构不同存储容量限制等因素在数据集中存储跨库操作等环节存在诸多问题数据仓库是将来自不同来源的数据聚合到集中且一致的数据存储系统中并解决传统关系型数据库无法跨库操作的问题其功能集中于从其他来源提取清理和准备数据以及在关系数据库中加载和维护数据并通过数据挖掘人工智能等技术进行数据价值分析数据仓库从架构设计来看分为底层多元异构数据汇聚层中层OLAP处理层和顶层数据应用层敬请阅读末页的重要说明6行业深度报告图1数据仓将多源数据聚合并进行价值挖掘资料来源brainstation招商证券表2数据仓库架构设计架构详细底层一般由多个业务库组成关系数据库通过ETL过程对多个业务库底层数据进行提取清洗转换等操作中层主要为OLAP库可实现数据的快速分析OLAP架构一般分为中层ROLAPMOLAPHOLAP三种具体根据业务需求进行选择顶层为前端数据应用层根据数据分析结果生成报表等帮助管理层做辅助顶层决策资料来源腾讯云dataversity招商证券底层数据仓库通过ETL过程实现多源数据汇聚数据仓库对多源数据进行采集并经过数据分层处理得到统一的规范的数据后可以进行大数据分析其核心是把数据从OLTP过程转换到OLAP平台的一个过程其中需要对数据进行操作和建模这个过程统称为ETLExtract-Transform-Load主要是指将源数据经过抽取清洗转换之后加载到数据仓库目的是将业务库中的分散零乱标准不统一的数据整合到一起为企业的决策提供数据基础中层数据存储和处理方式层面看HOLAP混合型成为重要方向数据仓库主要因分析型OLAP需求而诞生其实现路径主要包括MOLAPROLAPHOLAP目前正朝着HOLAP混合型方向发展OLAP有多种实现方法根据存储数据的方式不同可以分为ROLAPMOLAP以及将前两者取长补短的HOLAP目前OLAP发展更偏向于HOLAP因为大厂既不想丢弃一直使用的关系型数据库又想在数据分析能力上获得进一步提升所以HOLAP方向成为更好的选择敬请阅读末页的重要说明7行业深度报告表3MOLAPROLAPHOLAP详解分类详细优劣势适用场景优势1查询时无需进行复杂计算且以数组形式可以进行高效的免索引数据访问用户发起的查询均能够稳定地快速适用于查询场景相对固MOLAP需要对原始数据进行预响应2最后存储的预处理数据为高度聚合化可以进行压定并且对查询性能要求基于多维计算得到需要的所有结缩等操作来减少存储占用空间非常高的场景如广告数据组织果并将其存储到优化劣势1需要进行预计算存储需要花费较多时间无法保主经常使用的广告投放的OLAP过的多维数组存储证数据的实时性如果需要发生变化需要进行预定模型之2报表分析外新的查询操作需要重新进行建模和预计算不具有灵活性适用于对查询模式不固优势1无需进行数据预处理查询灵活可扩展性更好定灵活性要求高的场ROLAP2数据入库效率更高可以保证数据的实时性直接将原始数据同步景如数据分析师的数基于关系无需预计算在每次查劣势在查询计算较为复杂的场景下需要较长时间返回结据分析类产品会对数型数据库果本质上是把预计算所需的时间分摊到询时进行即时计算ROLAPMOLAP据做各种预先不能确定的OLAP了用户的每次查询上会影响用户实时查询体验并消耗较的分析所以需要更高多算力资源的查询灵活性将MOLAP和ROLAP优点互补对于频繁而稳优势结合了MOLAP和ROLAP的优势之处并且提供了HOLAP定但又耗时的查询通聚合数据的快速查询同时因为它仅将聚合信息存储在混合数据过预计算来提速对于OLAP服务器上而详细记录保留在关系数据库中因此减具有通用性组织的运算较少发生次数较少了数据冗余平衡了磁盘空间需求OLAP少或新的查询需求像劣势需要同时支持MOLAP与ROLAP导致架构更为复杂ROLAP一样直接通过维护难度也更高计算来提取资料来源javatpointCSDN招商证券中层数据建模层面看从实体-关系模型走向星型雪花型数据仓库通过数据建模将数据进行关联主要基于事实表与维度表通过事实表将各个维度表进行关联从而建立完整的数据模型其中事实表是指处于数据结构的中心存储某种业务各个维度的数据其中各个维度一般都是对应编码其本质可以理解为关注的内容索引列表维度表可以看作是事实表的发散表对应着事实表里面的每一个维度根据业务需要可以选择需要的细分维度进行分析关联本质为将分析目标的多维度内容进行存储数据仓库的数据模型根据事实表与维度表的关系可以分为星型Star与雪花Snowflake模型星型模型中所有维度表直接与事实表关联不存在渐变维度有一定数据冗余产生雪花模型中有一个或多个维表没有直接连接到事实表而是通过其他维表连接到事实表上对星型模型的维表进一步层次化雪花模型是对星型模型的扩展敬请阅读末页的重要说明8行业深度报告图2事实表与维度表示意图资料来源腾讯云开发者社区招商证券图3星型模型与雪花模型示意图资料来源腾讯云开发者社区招商证券3数仓核心功能二通过数据分层解耦合实现业务与分析分离为了防止数据分析对业务数据库的干扰数据仓库另一核心功能为解耦合即通过建立数据仓库达到业务处理与数据分析分离的目的数据仓库除了将异构数据库汇集解决跨库操作的难题外将分析与业务解耦也解决了传统数据库对于分析的诸多痛点敬请阅读末页的重要说明9行业深度报告表4传统业务数据库用于分析的痛点痛点详细一般业务库会以尽可能简洁的方式进行存储表与表之间存在大量关联索引如进行结构复杂大大规模分析时查询需要花费大量时间并占用较高的资源可能会影响正常业务操规模查询困难作在业务过程中可能由于系统故障等原因产生一些偏差数据如果每次分析都对所有数数据不完善影据进行预处理需要耗费大量时间与资源不做处理会导致分析误差加大影响管响分析结果理层决策判断无法提供足够为了保证数据库对业务的实时响应效率一般不会存储很长历史的数据无法满足分的历史数据析需要大量历史数据的回溯资料来源帆软CSDN招商证券数据分层是帮助数据仓库实现解耦合能力的关键避免了因为数据分析而干扰数据库的业务操作由于数据仓库需要进行大量数据分析操作通过建立数据分层可以避免用户直接使用操作型数据并更高效的访问数据同时如果业务发生变化只需要根据需要调整底层数据使得业务调整并不会对应用层产生影响表5数据分层优势解析分层优势详细结构清晰每一个数据分层都有它的作用域和职责在使用表的时候能更方便地定位和理解减少重复计算通过通用的中间层数据能够减少极大的重复计算统一数据口径提供统一的数据出口统一对外输出的数据口径将复杂的任务分解成多个步骤来完成每一层只处理单一的步骤比较简单和容易简化问题理解当数据出现问题之后不用修复所有的数据只需要从有问题的步骤开始修复资料来源帆软CSDN招商证券图4常见的数据分层架构数据分层对数据进行层层加工资料来源CSDN招商证券4实时分析需求快速增长从离线数仓到实时数仓敬请阅读末页的重要说明10行业深度报告大数据时代下业务场景不断丰富实时分析的需求快速增长传统离线数仓的批处理引擎难以满足数据分析的实时性要求以流处理为核心的实时数仓快速发展离线数仓擅长深度复杂的分析但耗时较长无法满足实时性需求传统的离线数仓主要采用批处理计算引擎其优点为对于业务逻辑复杂数据规模有限的场景下具有更好的数据挖掘能力可以获得更优质的分析结果但其运算耗时较长时间跨度通常为分钟级到小时级因此难以满足实时分析的要求流处理模式强调处理速度是构建实时数仓的核心计算引擎实时计算一般采用流处理引擎与离线计算相比流处理减少了数据落地环节实时对每个新到达的数据或者比较小的窗口数据进行计算其分析计算量相对较小使其可以在毫秒级到秒级完成使时延可以达到实时系统要求目前实时数仓主要以Lambda架构离线实时混合与Kappa架构纯实时为主图5实时数仓分层架构图资料来源cnblogs招商证券表6实时分析应用场景举例场景具体智能推荐会根据用户历史的购买或浏览行为通过推荐算法训练模型预测用户未来可能会购买的物品或喜爱的资讯随着互联网快速发展用户对时延的要求越来越高通过建立实实时智能推荐时数仓对用户指标进行实时预测并将预测的信息推送给WebApp端帮助用户获取想要的资讯有助于帮助企业提升销售额创造更大的商业价值在金融业务中常常出现各种类型的欺诈行为例如信用卡欺诈信贷申请欺诈等随着欺诈手段的不断升级传统的反欺诈监测往往需要数小时才能通过交易数据计算出用户的行为实时欺诈检测指标然后通过规则判别出具有欺诈行为嫌疑的用户对于实效性大打折扣而运用实时数仓的流式计算能够在毫秒内就完成对欺诈行为判断指标的计算然后实时对交易流水进行实时拦截避免因为处理不及时而导致的经济损失有的客户需要做舆情分析要求所有数据存放若干年舆情数据每日数据量可能超百万年数据量可达到几十亿的数据而且爬虫爬过来的数据是舆情通过大数据技术进行分词之后得到的可能是大段的网友评论客户往往要求对舆情进行查询做全文本搜索并要求响应舆情分析时间控制在秒级爬虫将数据爬到大数据平台的Kafka里在里面做Flink流处理去重去噪做语音分析写到ElasticSearch里大数据的一个特点是多数据源大数据平台能根据不同的场景选择不同的数据源资料来源cnblogs招商证券5实时数仓架构演进从Lambda到Kappa从集中式到云原生敬请阅读末页的重要说明11行业深度报告1从Lambda到KappaLambda由于同时采用离线与实时两套计算引擎其架构复杂性大幅提升也带来一系列问题1一个架构需要两套代码维护繁琐基于实时与离线两套架构需要对两套代码分别修改独立测试同步上线整体开发维护难度较高2资源占用较高两套逻辑需要计算两次系统资源占用较高3实时与离线引擎数据处理差异易混淆由于流处理引擎尚不完善离线处理会对实时处理的结果再次计算最后以离线处理为准数据频繁变更容易引起混乱随着Flink等流处理引擎逐步成熟采用纯实时计算的Kappa架构出现解决了两套代码问题但由于采用全流处理流其吞吐能力弱于Lambda因此在真实的场景中很多时候采用Lambda与Kappa混合架构比如大部分实时指标使用Kappa完成计算少量关键指标如金额使用Lambda架构用批处理重新计算增加一次校对过程图6Lambda架构vsKappa架构资料来源cnblogsCSDN招商证券2从集中式到云原生顺应市场需求变化是数据仓库发展的核心驱动力目前正处于向云原生算储分离方向发展1初代数仓采用集中式部署其扩展成本高昂且存在瓶颈随着企业业务数据爆发式增长集中式部署存在明显瓶颈2第二代数仓采用Hadoop等分布式开源框架相较于集中式部署其具有灵活扩展能力对于算力与存储容量等方面均有大幅提升3随云计算的普及第三代数仓向云托管发展扩展能力与运维成本更加友好但数据仓库架构仍未解决存算一体化的根本问题使用存算耦合架构时两种资源互相影响需同步扩缩容无法根据需求灵活合理匹配资源经常造成资源的浪费和闲置以Snowflake为代表的第四代云原生数据仓库采用算储分离架构使得资源分配更加合理Snowflake基于云原生的数据仓库平台首创存算分离支持单独扩展实现两种资源的弹性使用使得企业可以根据自身业务需敬请阅读末页的重要说明12行业深度报告求对存储容量与计算资源进行合理分配并通过数据仓库平台为企业提供存储访问及数据分析能力表7数据仓库持续进化第一代第二代第三代第四代本地集中部署本地分布式部署云托管云原生基于HadoopHiveSpark等开按需分配云资源软硬一体架构算储分离资源分配更合理源分布式架构扩容能力大幅提升扩展性有限更低的成本数据分析门槛进一步降低适配百BP级数据计算更低的扩容成本扩容成本高昂更高的并发性能与更低的延迟灵活扩展运维成本降低资料来源CSDN招商证券图7Snowflake算储分离架构资料来源Snowflake招股书招商证券二国外市场新老玩家各具优势国内市场云厂商占据主导1数仓作为技术底座有望受益于BI需求增长数据仓库是BI的技术底座有望受益于BI需求增长数据仓库根据Gartner等官方定义即多个数据库上的大容量存储库它的作用在于存储大量的结构化数据并能进行频繁和可重复的分析帮助企业构建商业智能BI可以理解数仓即BI的技术底座通过从多源数据库系统提取数据进行清洗转换标准化等操作将数据加载到BI平台进而满足业务用户的数据分析和决策支持现代BI及分析工具细分赛道领涨商业智能市场大类根据Gartner现代BI及分析工具市场2015年和2019年增速分别为636179均为大类中增长最快类别预计全球现代BI及分析工具市场将从20年起以CAGR为16的增速增长至26年的130亿美元实现规模翻倍据研究机构ModorIntelligence预计全球数仓规模将与BI需求增长保持一致2023年全球数仓敬请阅读末页的重要说明13行业深度报告规模约为901亿美元预计2028年将达到1525亿美元2023-2028年复合增长率为1110其中以中国为代表的亚洲地区将是主要增长驱动力我们认为未来企业产生的数据将继续呈爆发式增长随之而来的是企业从海量数据中获取洞察以辅助决策的需求增长对BI应用的落地场景将不断丰富作为其技术底座的数据仓库应用亦将持续受益于前端BI的增长图8数仓市场活跃度地图图9全球数据仓库及BI市场规模亿美元BI数仓500CAGR96542494003002681200CAGR11101525901100020232028资料来源ModorIntelligence招商证券资料来源ModorIntelligence招商证券2海外市场新老玩家角逐激烈同质化较高以分析能力与生态建设为重要发力方向数据库云化是行业发展重要趋势Gartner研究显示2018年全球数据库管理系统收入增长184其中云数据库管理系统收入增长68达到460亿美元到2022年75的数据库都将部署或者迁移到云数据平台到2023年云数据库管理系统收入将占数据库管理系统市场总收入的50传统科技巨头布局较早凭借其完善的生态占据大量市场份额MicrosoftAWS等云服务龙头凭借在云数据库布局并通过自身客户规模与完善的生态在云数据仓库市场取得较高份额OracleIBMSAP等老牌关系型数据库龙头凭借在数据库领域的先天优势在数据仓库方面也取得领先优势以Snowflake为代表的新势力快速崛起以Snowflake为代表的新兴厂商具备以下优势1支持多云灵活部署Snowflake把自身架构同时部署于三大公有云之上根据SnowflakeCFO截止22年7月AWS承载Snowflake80的工作负载其余18分布在Azure上2分布在GoogleCloudPlatform上在多云支持方面具备优势2算储分离新型架构Snowflake率先采用算储分离弹性架构在成本端更具优势具有先发优势在前期快速抢占市场份额而传统厂商主要基于MPP架构对存量的架构升级投入较大具有一定滞后性表82017-2021Snowflake市场排名快速上升20172021排名厂商份额排名厂商份额1Oracle3611Microsoft240敬请阅读末页的重要说明14行业深度报告2Microsoft2152AWS2393IBM1273Oracle2064AWS924Google655SAP745IBM5629Snowflake-13Snowflake-资料来源Gartner墨天轮招商证券表9数据仓库代表玩家发布产品的时间产品初始版本发布时间GoogleBigQuery2010AmazonRedshift2013Snowflake2014MicrosoftAzure前身AzureSQLDataWarehouse于2016Synapse年发布Synapse于2019年发布资料来源GartnerHGInsightsIDCWiki墨天轮招商证券图10Snowflake前期客户数保持快速增长700016015259446000140客户数YoY120500041391004000807330002392602000444094810002000FY2019FY2020FY2021FY2022资料来源Snowflake招股书招商证券1微软AzureSynapse可实现多源数据集成聚焦上层BI应用AzureSynapse聚焦上层BI应用2016年AzureSQLDataWarehouseAzureSynapse的前身诞生2019年底微软宣布将SQLDataWarehouse升级为数据仓库数据分析一体化平台Synapse可实现多源数据集成可以将本地数据私有云公有云数据SaaS等多种数据源加载到Synapse中与Snowflake相比Synapse更聚焦于上层的BI应用且Synapse与微软生态中其他应用协同云数据生态系统成熟度高Synapse可与PowerBI实现数据的可视化与AzureMachineLearningSQL和Spark深度集成以训练机器模型敬请阅读末页的重要说明15行业深度报告图11AzureSynapse架构与Snowflake类似资料来源MicrosoftAzure官网招商证券图12MicrosoftAzure云数据生态系统成熟度高集数据存储分析可视化等功能于一体资料来源MicrosoftAzure官网招商证券2AmazonAWSRedshift引入RA3节点实现存算分离AWSRedshift拥有庞大的Amazon生态作为支撑与AWS产品等无缝连接作为AmazonWebServicesAWS生态系统的一部分Redshift数据仓库服务提供了诸如将用户数据从数据湖中导出并与其他平台如SalesforceGoogleAnalyticsFacebookAdsSlackJiraSplunk以及Marketo相集成等服务此外Redshift仓库服务使用列式存储数据压缩以及区域映射来实现高性能和高效存储与其他云原生数据仓库相比Redshift劣势在于维护难度较大Redshift需要大量手动维护且需要有一定AWS架构知识的人员监控集群以提高性能Redshift迎合行业存算分离趋势较慢由于AWSRedshift本身采用MPP架构即存储与计算共享一个节点数据存储在计算节点中下图中红框随其他巨头数仓产品相继效仿Snowflake采取创新架构而未实现存算解耦的Redshift受到诟病颇多为迎合客户需求与行业趋势Redshift后于2019年底引入节点RA3实现存算分离支持存储和计算资源的独立拓展敬请阅读末页的重要说明16行业深度报告图13AWSRedshift主架构采用MPP数据存储在计算节点中资料来源AWSRedshift招商证券3GoogleBigQuery特有元素鲜明生态完善云原生数据仓库BigQuery源自谷歌内部工具的整合起初Google发明工具ColossusJupiter和Dremel以解决海量数据的存储和查询需求且仅供内部使用其中Dremel是BigQuery的查询执行引擎高度可扩展的系统旨在对PB级数据集处理Colossus是分布式文件系统用于数据的备份Jupiter网络是Colossus存储和Dremel执行引擎之间的桥梁后Google将这些工具整合到谷歌云平台上并对外产品化更名BigQueryBigQuery基于谷歌强大的技术与生态加持在机器学习大数据分析等方面具有较强优势其中BigQueryML使用SQL即可进行机器模型的训练和使用目前支持包括K-means深度神经网络等10种模型BigQueryGIS实现对地理空间分析的原生支持进而挖掘位置信息价值高级分析功能BigQueryBIEngine允许用户以互动方式分析BigQuery中大型数据集大数据生态系统集成BigQuery借助Dataproc和Dataflow实现与Apache大数据生态系统的集成HadoopSpark能够使用StorageAPI直接从BigQuery读写数据敬请阅读末页的重要说明17行业深度报告图14GoogleBigQuery架构资料来源Google招商证券数据仓库产品功能具有一定同质化以机器学习为核心的分析能力与生态建设是重要发力方向海外云数据仓库产品功能同质化较高Snowflake率先实现存算分离掀起行业变革浪潮巨头纷纷效仿优化自身架构均以实现存算弹性化提升以机器学习为核心的分析能力是各厂商重要的发力方向科技巨头与自身技术积累结合Snowflake则是选择与第三方平台Zepl等进行合作科技巨头数仓可以与自身生态无缝集成具备先天优势亚马逊谷歌及微软等凭借完善的生态体系与其数仓产品进行功能协同增加各自数仓的竞争力提供与其他产品无缝衔接的使用体验具有先天优势Snowflake也在通过SnowflakePartnerConnect的合作伙伴不断强化自身生态建设表10云数据仓库海外代表产品同质化程度较高Micorsoft功能AWS-RedshiftGoogle-BigQuerySnowflakeAzure-Synapse数据处理能力PB级别PB级别PB级别PB级别存储空间和计算空间的否是是是独立拓展能力弹性根据工作负载上是是是是下调整计算能力自动暂停和恢复在没不适用Serverless架构有查询需求时自动停否是是无需客户控制止提供原生本身不能运行机器PREDICT语句学习没有专门的AmazonSagemaker可该语句可以对在机器学习组件但大规模快速构建训练和用户可通过SQL语句执ApacheSpark或等分析及机器学习能力与第三方数据分析部署ML模型行机器学习模型框架中训练的机器平台如Zepl进AmazonRedshiftML学习模型评分无需行集成以提供该功执行大规模数据移能动敬请阅读末页的重要说明18行业深度报告集成能力有限可与AWS一系列服务集以通过其他入口集成包括KinesisData与GoogleCloud成部分Amazon服与其他Azure产品集成能力FirehoseSageMakerPlatform一系列服务集务例如使用轻松集成EMRGlueDynamoDB成Snowpipe将AWS等上的数据导入到Snowflake24个分布于美洲欧34个分布于美洲欧60余个分布于美22个分布于北美数据仓库部署地区数量洲亚太地区中东及非洲亚太地区中东及洲欧洲非洲及亚洲欧洲及亚太地洲非洲太地区区维护负担低管理用户对平台的管理和维成本较高难度较大需维护负担低近乎为0和运维成本几乎为维护负担低护难度要AWS架构知识Google负责运维0Snowflake负责运维资料来源各公司官网招商证券3国内市场与海外厂商差距缩小云厂商占据主导中国大数据软件规模占比与海外仍有较大差距十四五期间有望快速发展根据IDC2021年全球大数据市场的IT总投资规模为21761亿美元并有望在2026年增至44911亿美元2021-2026年CAGR约为156中国市场方面2022年中国大数据市场总体IT投资规模约为170亿美元并将在2026年增至3649亿美元实现规模翻倍与全球总规模相比中国市场在五年预测期内占比持续增高有望在2024年超越亚太除中日总和并在2026年接近全球总规模的8作为大数据市场中高增长细分赛道头部选手数据仓库具有较强成长潜力数据分析需求在海量数据时代不断增长大数据技术是满足数据分析需求的有利工具其核心在于从海量数据中挖掘价值而数据挖掘与分析链条的第一环即是数据仓库我们认为数据仓库成长空间有望与数据分析需求市场空间保持同比例增幅根据IDC2022年下半年中国数据仓库软件市场跟踪报告2022年中国数据仓库软件市场规模为87亿美元同比增长237其中本地部署数据仓库软件规模为46亿美元同比增长125公有云数据仓库软件规模为41亿美元同比增长393到2027年中国数据仓库软件市场规模预计将达到273亿美元2022-2027的5年市场年复合增长率CAGR为257图预计年中国大数据市场规模将翻图年我国数据仓库软件市场规模预测15IDC2021-2026162023-2027倍增长资料来源IDC招商证券资料来源IDC招商证券敬请阅读末页的重要说明19行业深度报告Gartner魔力象限显示中国厂商实力不断增强与海外巨头差距正持续缩小2016年星环科技进入Gartner数据仓库和数据管理魔力象限的远见者象限在前瞻性维度上优于ClouderaHortonworks等美国主流大数据平台厂商是国内第一家入选厂商2017年华为云入选2018年阿里云入选2021年阿里云已进入云数据库管理系统的领导者象限与海外相似在国内数仓竞争中云厂商占据主导根据IDC国内市场对大数据平台需求较高的行业主要包括政府金融运营商互联网等行业1传统政企金融等领域对于大数据建设的关注点在于软硬件的高度集成安装部署实施运维服务以及在大数据平台之上的数据分析应用其中华为云具备完善的产品体系以及在政企等大客户积累广泛具有较强竞争优势2互联网行业用户的关注点在于弹性可扩展性能成本与性价比并且对最前沿的技术高度关注阿里云凭借其在公有云上积累的大批互联网行业用户牢牢占据公有云数仓主要份额3亚马逊云科技则依托智能湖仓一体全面丰富的数据管理及分析产品组合在中国市场获得大批公有云用户图17星环科技2016年进入Gartner数据仓库及数据管理解决方案魔力象限左图阿里腾讯2022年位列Gartner云数据库管理方案魔力象限中右图资料来源Gartner招商证券图我国数据仓库软件市场厂商份额本地部署模图我国数据仓库软件市场厂商份额公有云模式1819式2022H22022H2资料来源IDC招商证券资料来源IDC招商证券敬请阅读末页的重要说明20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1