行业观点
AI基础数据服务商脱胎于专业数据采标分工需求.国内AI基础数据服务产业主要包括上游-数据产生及产能资源、中游-训练数据生产、下游-Al算法研发三大产业环节,数据工程是AI工程基础环节,目前正处于市场格局渐趋清晰,新老技术迭代、下游需求加速释放的关键节点。 AI快速落地叠加数据量指数级跃升,2025年国内百亿规模可期。场景侧,Al已在金融、医疗、交通、安防等多个垂直场景深度落地,且应用场景拓展势能强劲,伴生数据海量增长;产品侧,据信通院,自OpenAl于2020年推出GPT-3以来,超大预训练模型参数数量、训练数据规模按照30O倍/年的趋势增长,客观推动高质量数据需求指数级扩张,据艾瑞咨询,2025年我国AI基础数据服务市场或达101亿元,相较2022年翻倍。 AI大模型催生高要求和新需求,专业化数据集及AI训练师需求利好海夭瑞声等优质专业数据解决方案提供商。A大模型时代无监督/半监督训练重回主流,“基础模型+微调”成为Al开发新范式,RLHF微调技术催生两大新兴需求,一是预训练阶段催生A厂商对标注完善、清洗完备的各类专业化场景数据集的需求;二是交互奖励阶段催生AI厂商对于具备专业事实判断与规范价值判断的人工智能训练师的需求,目前两类新兴需求尚未得到充分有效的市场供给。伴随超大规模预训练模型推动训练数据指数级跃升,市场蓝海亟待填补。 自动驾驶训练数据需求方兴未艾,海天瑞声发力布局。自动驾驶约占我国A基础数据服务市场规模的35%,系第一大下游场景,2025年市场规模或达25亿元,自动驾驶领域的业务类型可分为车载摄像头采集的2D图像数据标注与激光雷达采集的3D点云数据标注,目前业内客户对于全栈式闭环数据解决方案需求较高。 国内市场集中度趋势性收敛,海天瑞声具备领先优势。伴随需求侧Al垂直场景及专业化需求凸显,数据需求量提升但数据采标业务门槛提高;供给端国内数据安全标准及相关资质要求提升,相关解决能力向头部厂商聚集,以海夭瑞声、Appen为代表的品牌数据服务商未来将替代中小型供应商成为市场主要供应力量。据IDC,2021年海夭瑞声在国内A基础数据服务行业市占率高达12.9%,位居第一。Appen在覆盖区域、语种l方言覆盖能力等方面更具优势。 海外对标: Appen,全球A基础数据服务龙头。公司近五年营收CAGR达27.2%,主营业务包括数据采集、数据预处理与模型评价三大类,业务类型齐全,主要客户包括Google、Amazon、Microsoft等知名IT巨头,客户质量较高。全球范围看,Appen位居全球A基础数据服务行业收入体量首位,员工量能及标注技术均领先同业,他山之石可以攻玉,对于国内厂商而言,积极卡位全球AI头部客户将有助获得大模型预训练的业务红利;持续拓宽业务矩阵,开辟模型评价模块主动挖掘客户数据需求将有助于纵向做深客户价值;夯实数据采标技术,紧跟行业趋势发展包括机器标注在内的先进数据采标技术将有助于筑牢自身业务护城河。 投资建议 AI基础数据服务行业,需求侧Al垂直场景及专业化需求凸显,数据需求量提升但数据采标业务门槛提高;供给端国内数据安全标准及相关资质要求提升,相关解决能力向头部厂商聚集,推荐关注国内业内领军海夭瑞声。 风险提示 产业需求快速迭代带来研发投入回收不确定性风险;训练数据泄露引发的安全性风险;市场竞争加剧导致利润受到挤压的风险。 研究报告全文:AI基础数据服务商脱胎于专业数据采标分工需求国内AI基础数据服务产业主要包括上游-数据产生及产能资源中游-训练数据生产下游-AI算法研发三大产业环节数据工程是AI工程基础环节目前正处于市场格局渐趋清晰新老技术迭代下游需求加速释放的关键节点AI快速落地叠加数据量指数级跃升2025年国内百亿规模可期场景侧AI已在金融医疗交通安防等多个垂直场景深度落地且应用场景拓展势能强劲伴生数据海量增长产品侧据信通院自OpenAI于2020年推出GPT-3以来超大预训练模型参数数量训练数据规模按照300倍年的趋势增长客观推动高质量数据需求指数级扩张据艾瑞咨询2025年我国AI基础数据服务市场或达101亿元相较2022年翻倍AI大模型催生高要求和新需求专业化数据集及AI训练师需求利好海天瑞声等优质专业数据解决方案提供商AI大模型时代无监督半监督训练重回主流基础模型微调成为AI开发新范式RLHF微调技术催生两大新兴需求一是预训练阶段催生AI厂商对标注完善清洗完备的各类专业化场景数据集的需求二是交互奖励阶段催生AI厂商对于具备专业事实判断与规范价值判断的人工智能训练师的需求目前两类新兴需求尚未得到充分有效的市场供给伴随超大规模预训练模型推动训练数据指数级跃升市场蓝海亟待填补自动驾驶训练数据需求方兴未艾海天瑞声发力布局自动驾驶约占我国AI基础数据服务市场规模的35系第一大下游场景2025年市场规模或达25亿元自动驾驶领域的业务类型可分为车载摄像头采集的2D图像数据标注与激光雷达采集的3D点云数据标注目前业内客户对于全栈式闭环数据解决方案需求较高国内市场集中度趋势性收敛海天瑞声具备领先优势伴随需求侧AI垂直场景及专业化需求凸显数据需求量提升但数据采标业务门槛提高供给端国内数据安全标准及相关资质要求提升相关解决能力向头部厂商聚集以海天瑞声Appen为代表的品牌数据服务商未来将替代中小型供应商成为市场主要供应力量据IDC2021年海天瑞声在国内AI基础数据服务行业市占率高达129位居第一Appen在覆盖区域语种方言覆盖能力等方面更具优势海外对标Appen全球AI基础数据服务龙头公司近五年营收CAGR达272主营业务包括数据采集数据预处理与模型评价三大类业务类型齐全主要客户包括GoogleAmazonMicrosoft等知名IT巨头客户质量较高全球范围看Appen位居全球AI基础数据服务行业收入体量首位员工量能及标注技术均领先同业他山之石可以攻玉对于国内厂商而言积极卡位全球AI头部客户将有助获得大模型预训练的业务红利持续拓宽业务矩阵开辟模型评价模块主动挖掘客户数据需求将有助于纵向做深客户价值夯实数据采标技术紧跟行业趋势发展包括机器标注在内的先进数据采标技术将有助于筑牢自身业务护城河AI基础数据服务行业需求侧AI垂直场景及专业化需求凸显数据需求量提升但数据采标业务门槛提高供给端国内数据安全标准及相关资质要求提升相关解决能力向头部厂商聚集推荐关注国内业内领军海天瑞声产业需求快速迭代带来研发投入回收不确定性风险训练数据泄露引发的安全性风险市场竞争加剧导致利润受到挤压的风险敬请参阅最后一页特别声明1行业深度研究深度内容目录1AI基础数据服务脱胎于专业数据标注需求2025年国内百亿规模可期511产业图谱AI基础数据服务脱胎于专业数据采标分工需求512发展历程站在人工标注市场出清与机器标注迭代的十字路口513市场规模AI快速落地叠加数据量指数级跃升2025年国内百亿规模可期614政策支持近五年国家政策加持国内AI产业发展82AI大模型催生高要求新需求专业化数据集及AI训练师需求利好优质专业数据提供厂商1021场景特质AI大模型时代无监督半监督训练成为主流RLHF催生新兴需求1022场景需求预训练阶段高质量专业数据集交互奖励阶段人工智能训练师1123场景价值超大规模预训练模型推动训练数据指数级跃升市场需求持续延展123自动驾驶领域训练数据需求方兴未艾海天瑞声发力布局1231场景特质自动驾驶客户需求全栈式闭环数据解决方案1232场景需求自动驾驶领域数据标注分为2D图像标注与3D点云标注1433场景价值自动驾驶训练数据市场方兴未艾2025年国内市场规模或达25亿元144国内市场集中度趋势性收敛海天瑞声具备领先优势1541发展趋势品牌商价值效应凸显国内市场集中度持续收敛1542竞争格局业内主要玩家发展各有侧重Appen及海天瑞声具备领先优势1643他山之石Appen发展复盘全球AI基础数据服务巨头的崛起之路195投资建议206风险提示21敬请参阅最后一页特别声明2行业深度研究深度图表目录图表1AI基础数据服务商脱胎于专业数据标注分工需求5图表2数据工程约占AI工程80时长Garbageingarbageout效应显著5图表372的全球受访者认为至少需要超过10万条训练数据进行模型训练6图表496的全球受访者在训练模型的过程中遇到训练数据质量不佳效率不足的问题6图表5AI数据工程发展历程及展望6图表62025年全球AI市场规模或达22187亿美元7图表72022年国内AI市场规模或达116亿美元7图表820182025年全球数据量CAGR或达2697图表920182025年中国数据量CAGR或达3047图表102025年我国AI基础数据服务市场或达101亿元相较22年翻倍7图表112019年我国AI基础数据服务各类型数据需求占比7图表12近五年国家政策加持国内AI产业发展8图表13AI大模型传统数据标注需求下降10图表14OpenAI开展RLHF三步骤11图表15RLHF需求预训练阶段高质量专业数据集交互奖励阶段人工智能训练师12图表16超大规模预训练模型参数及数据规模近年来指数级跃升12图表17自动驾驶场景中的AI基础数据服务需求13图表18自动驾驶客户需求全栈式闭环数据解决方案13图表19自动驾驶场景中的AI基础数据服务业务类型14图表202020年自动驾驶约占AI基础数据服务市场规模的3515图表212025年我国自动驾驶AI基础数据服务市场规模或达249亿元15图表222019年我国AI基础数据服务市场竞争格局15图表232019年我国AI基础数据服务市场CR515图表24业内主要品牌数据商16图表25业内主要玩家指标对比16图表26智能语音类训练数据产品对比17图表27通用语音识别训练数据产品对比17图表28车载语音识别训练数据产品对比18图表29特色语音识别训练数据产品对比18图表30自然语言训练数据产品对比18图表31计算机视觉训练数据产品结构对比19图表32AI基础数据服务巨头近五年营收CAGR达27219图表33Appen业务类型齐全客户质量较高20敬请参阅最后一页特别声明3行业深度研究深度图表34Appen处于员工量能及标注技术矩阵头部位置20图表35推荐关注国内AI基础数据服务领军者海天瑞声21敬请参阅最后一页特别声明4行业深度研究深度11产业图谱AI基础数据服务脱胎于专业数据采标分工需求国内AI基础数据服务产业主要包括上游数据产生及产能资源中游训练数据生产下游AI算法研发三大产业环节其中部分产业环节重合度较高AI基础数据服务商主要脱胎于专业数据采标分工需求上游主要包括数据生产者和数据生产组织者主要提供原料数据的采集服务中游主要由基础数据服务商构成通过数据处理能力和项目管理能力完成训练数据集结构设计数据加工和质量检测等工作为下游客户提供训练数据产品和相关服务AI基础数据服务整体可分为两大类一种是具备自有的标注基地或全职标注团队这类企业也参与产业上游部分直接提供产能资源另一种是依靠众包或外包模式专注于数据产品的开发与项目执行下游包括科技公司行业企业AI公司和科研单位等主要负责算法研发部分下游AI公司拥有自主的标注工具也可通过AI中台获取一些通用标注工具少数数据需求大的企业还孵化了自主的数据服务团队图表1AI基础数据服务商脱胎于专业数据标注分工需求来源海天瑞声招股说明书艾瑞咨询2019年中国人工智能基础数据服务行业白皮书国金证券研究所12发展历程站在人工标注市场出清与机器标注迭代的十字路口理论层面数据工程系AI工程基础环节核心在于高效的数据标注AI工程数据工程模型工程其中数据工程主要包括数据采集与数据标注约占AI工程时长的80模型工程主要包括模型训练与模型部署约占AI工程时长的20数据工程是AI工程的前置且基础环节直接影响到模型的质量与精度数据工程的核心在于高效的数据标注Garbageingarbageout效应显著图表2数据工程约占AI工程80时长Garbageingarbageout效应显著来源整数智能国金证券研究所实践层面AI模型训练数据需求规模大训练数据质量不佳效率低下情况普遍据敬请参阅最后一页特别声明5行业深度研究深度DimensionalResearch全球调研报告72的受访者认为至少使用超过10万条训练数据进行模型训练才能保证模型有效性和可靠性96的受访者在训练模型的过程中遇到训练数据质量不佳数量不足数据标注人员不足等难题为应对训练数据所带来的多方面挑战AI企业开始从第三方购买原料数据收集训练数据生产和数据专家咨询等服务图表372的全球受访者认为至少需要超过10万条训图表496的全球受访者在训练模型的过程中遇到训练练数据进行模型训练数据质量不佳效率不足的问题大于1000万未曾遇到问10缺少标注工题4少于10万具27数据偏差或100-1000万28缺少标注团错误6619队28数据不可直接使用50数据量不足10万-100万5143来源海天瑞声招股说明书转引自DimensionalResearch国金证券研究所来源海天瑞声招股说明书转引自DimensionalResearch国金证券研究所AI数据工程发轫于AI产业落地元年系AI下游应用的基础且必备环节目前行业处于市场格局渐趋清晰新老技术面临迭代下游需求加速释放的关键节点产业初生期201020162010年语音识别和计算机视觉领域产生重大突破国内开始萌生AI概念后续数年早期的AI基础数据服务门槛较低质量参差不齐产生成长期20162022近五年来供给侧高烈度的业内竞争加速市场出清需求侧对产业落地以及垂直场景的定制化数据采标需求逐渐凸显最终引致行业头部企业浮出水面行业格局逐渐清晰产业成熟期2022至今2022年以来AIGC产品集中爆发高level自动驾驶需求加速释放传统人工标注的效率已不能完全满足算法需求行业护城河转向自动化机器标注技术预计产业将进入向技术要市场的新阶段图表5AI数据工程发展历程及展望来源艾瑞咨询2019年中国人工智能基础数据服务行业白皮书国金证券研究所13市场规模AI快速落地叠加数据量指数级跃升2025年国内百亿规模可期国内AI市场规模超百亿美金约占全球市场10份额目前AI已在金融医疗交通安防等多个垂直场景深度落地且应用场景拓展势能强劲商业化进程加速从全球市场看据IDC2021年全球AI产业规模达8857亿美元预计2025年将达到22187亿美元CAGR高达258从国内市场看据IDC2022年我国AI产业规模或达116亿美元预计未来数年仍保持两位数增长以2021年计国内AI市场规模约占全球10国内市场成长潜力巨大国内企业出海空间广阔敬请参阅最后一页特别声明6行业深度研究深度图表62025年全球AI市场规模或达22187亿美元图表72022年国内AI市场规模或达116亿美元20045172403741147150303511627302510089206317461550105002019A2020E2021E2022E2023E2024E中国人工智能市场规模亿美元YoY来源海天瑞声招股说明书转引自IDC国金证券研究所来源海天瑞声招股说明书转引自IDC国金证券研究所全球数据量呈指数式增长中国数据量增速跑赢全球据IDC全球每年生产的数据量将从2018年的33ZB猛增至2025年的175ZB其中结构化数据仅占到全部数据量的20其余80都是以文件形式存在的非结构化和半结构化数据日志文件机器数据等占非结构化数据的90产生了源源不断的数据清洗与标注需求相比之下中国的数据量增速领跑全球平均每年增速比全球快32018年中国的数据量为76ZB占全球总量的234预计到2025年将增至486ZB占全球总量的278CAGR高达304图表820182025年全球数据量CAGR或达269图表920182025年中国数据量CAGR或达304来源海天瑞声招股说明书转引自IDC国金证券研究所来源海天瑞声招股说明书转引自IDC国金证券研究所中国AI基础数据服务行业市场规模2025年有望突破百亿一方面随着算法模型技术理论和应用场景的优化和创新AI产业对训练数据的拓展性需求和前瞻性需求均快速增长另一方面随着业内对训练数据需求类型的增加以及对服务标准要求的提高产业链的专业化分工将愈加清晰专业化的训练数据服务提供商将扮演更加重要的角色据艾瑞咨询2019年中国AI基础数据服务行业市场规模达309亿元其中图像类语音类NLP类数据需求规模占比分别为497391和112预计2025年国内AI基础数据服务行业市场规模将突破100亿元年复合增长率高达218图表102025年我国AI基础数据服务市场或达101亿图表112019年我国AI基础数据服务各类型数据需求元相较22年翻倍占比12031835101130NLP类数据100248需求11276725801960211178185614206017542850715363图像类数据4030925910需求497205语音类数据00需求391201820192020E2021E2022E2023E2024E2025E我国AI基础数据服务市场规模亿元来源艾瑞咨询中国AI基础数据服务行业发展报告2020国金证券研来源艾瑞咨询中国AI基础数据服务行业发展报告2020国金证券研究所究所敬请参阅最后一页特别声明7行业深度研究深度14政策支持近五年国家政策加持国内AI产业发展近五年国家系列政策推动国内AI产业蓬勃发展十四五规划指出要加快数字化发展建设数字中国同时打造数字经济新优势充分发挥海量数据和丰富应用场景优势促进数字技术与实体经济深度融合赋能传统产业转型升催生新产业新业态新模式壮大经济发展新引擎在国家顶层设计的支持下我国AI基础数据服务行业稳步发展行业训练资源库等细分应用领域的产业价值逐步凸显图表12近五年国家政策加持国内AI产业发展实施时间颁布主体主要法律法规及行业政策相关内容人工智能首次进入指导目录名单包括面向社会开放的战略性新兴产业重点产品和服务文本语音图像视频地图及行业应用数据等多类2017年2月国家发改委指导目录型海量训练资源库和标准测试数据集在内的公共数据平台成为人工智能方向的重要子方向之一到2020年总体技术和应用与世界先进水平同步到2025年基础理论实现重大突破部分技术与应用达到2017年7月国务院新一代人工智能发展规划世界领先水平到2030年理论技术与应用总体达到世界领先水平成为世界主要人工智能创新中心人工智能写入十九大报告将推动互联网大数据人2017年10月十八届中央委员会十九大报告工智能和实体经济深度融合行动计划从推动产业发展角度出发结合中国制造2025对新一代人工智能发展规划相关任务进行促进新一代人工智能产业发展2017年12月工业和信息化部了细化和落实信息技术与制造技术深度融合为主线2018-2020年以新一代人工智能技以术的产业化和集成应用为重点推动人工智能和实体经济深度融合国家电子技术标准人工智能标准化子技术化白皮2018年1月全面推进人工智能标准化工作促进产业发展化研究院书人工智能再次被列入政府工作报告加强新一代人工智2018年国务院2018年3月国务院能研发应用在医疗养老教育文化体育等多领政府工作报告域推进互联网发展智能产业拓展智能生活到2020年基本完成适应新一代人工智能发展的高校科技创新体系和学科体系的优化布局到2025年高校高等学校人工智能创新行动计在新一代人工智能领域科技创新能力和人才培养质量显2018年4月教育部划著提升到2030年高校成为建设世界主要人工智能创新中心的核心力量和引领新一代人工智能发展的人才高地人工智能是引领新一轮科技革命和产业变革的战略性技术具有溢出带动性很强的头雁效应人工智能正在对经济发展社会进步国际政治经济格局等方面产生人工智能发展现状和趋势第九次集2018年10月中共中央政治局重大而深远的影响加快发展新一代人工智能是我们赢体学习得全球科技竞争主动权的重要战略抓手是推动我国科技跨越发展产业优化升级生产力整体跃升的重要战略资源基于促进新一代人工智能产业发展三年行动计划2018-2020年中部署的重点任务和目标人工智新一代人工智能产业创新重点任2018年11月工业和信息化部能揭榜工作将在17个方向及细分领域征集并遴选一务揭榜工作方案批掌握关键核心技术具备较强创新能力的创新主体以突破产业发展的短板和瓶颈加快我国人工智能产业敬请参阅最后一页特别声明8行业深度研究深度与实体经济深度融合促进人工智能和实体经济深度融合要把握新一代人工智能发展的特点坚持以市场需求为导向以产业应用中央全面深化改革关于促进人工智能和实体经济深为目标深化改革创新优化制度环境激发企业创新2019年3月委员会度融合的指导意见活力和内生动力结合不同行业不同区域特点探索创新成果应用转化的路径和方法构建数据驱动人机协同跨界融合共创分享的智能经济形态明确指出开放共享是推动我国人工智能技术创新和产业发展的重要理念鼓励开放创新平台面向细分领域国家新一代人工智能开放创新平2019年8月科学技术部建设标准测试数据集促进数据开放和共享形成标准台建设工作指引化模块化的模型中间件及应用软件以开放接口模型库算法包等方式向社会提供软硬件开放共享服务明确指出试验区建设以促进人工智能与经济社会发展深度融合为主线重点任务包括加强网络基础设施大数国家新一代人工智能创新发展试2019年8月科学技术部据基础设施计算基础设施建设提升传统基础设施的验区建设工作指引智能化水平形成支撑新一代人工智能广泛应用的基础设施体系加快新型基础设施建设新基建进度新基建范围中共中央政治局常包括以人工智能云计算区块链等为代表的新技术基2020年3-4月中央政治局常委会会议重要讲话委会国家发改委础设施以数据中心智能计算中心为代表的算力基础设施等中共中央国务院关于构建更加完首次将数据作为市场化要素写入国家顶层设计级别文2020年4月中共中央国务院善的要素市场化配置体制机制的意件提出要加快培育数据要素市场发挥数据在市场化见配置中的作用国家发改委科技国家新一代人工智能标准体系建加强人工智能领域标准化顶层设计推动人工智能产业2020年8月部工业和信息化设指南技术研发和标准制定促进产业健康可持续发展部十四五规划指出要加快数字化发展建设数字中国同时打造数字经济新优势充分发挥海量数据和丰富应用场景优势促进数字技术与实体经济深度融合赋能中华人民共和国国民经济和社会十三届全国人大四传统产业转型升级催生新产业新业态新模式壮大经2021年3月发展第十四个五年规划和2035年次会议济发展新引擎同时指出要加强关键数字技术创新应用远景纲要聚焦高端芯片操作系统人工智能关键算法传感器等关键领域建设重点行业人工智能数据集发展算法推理训练场景意见指出我国人工智能仍存在对场景创新认识不到位关于加快场景创新以人工智能高重大场景系统设计不足场景机会开放程度不够场景2022年7月科技部等六部门水平应用促进经济高质量发展的指创新生态不完善等问题需要加强对人工智能场景创新导意见工作的统筹指导截至2022年10月北京拥有人工智能核心企业1048北京市经济和信息2022年北京人工智能产业发展家占我国人工智能核心企业总量的29数量位列全2023年2月化局白皮书国第一核心区域产业集聚能力全国第一已经形成了全栈式的人工智能产业链来源海天瑞声招股说明书转引自中国政府网中国政府网国金证券研究所敬请参阅最后一页特别声明9行业深度研究深度21场景特质AI大模型时代无监督半监督训练成为主流RLHF催生新兴需求大模型时代无监督半监督训练成为主流AI模型的训练方法主要包括监督学习和无监督学习两种典型方式后随模型训练数据量的增加衍生出半监督学习方法AI训练方法的发展历经监督-无监督-监督-无监督半监督4个阶段在目前的大模型阶段无监督半监督训练再次成为主流监督学习与无监督学习的主要区别在于是否使用带有人工标注的数据集训练数据半监督学习则是使用大量未标注数据少量标注数据进行训练图表13AI大模型传统数据标注需求下降来源华章科技阿里云开发者社区国金证券研究所大模型时代基础模型微调成为AI开发新范式RLHF微调技术催生更高要求的数据标注需求AI大模型由海量数据通过无监督学习训练得到本身并不能直接应用于具体任务必须经过微调才可投入应用微调是指基于大规模基础模型在现有训练得到的模型参数之上针对特定任务类型应用特定场景的数据对模型进行二次训练通俗来说大规模基础模型为AI提供了基础知识而微调则是让AI获特定领域知识并赋予其组织应用知识的能力以近日备受关注的ChatGPT为例在其微调技术RLHF强人工反馈系统当中第一步预训练阶段模型首先需要在标注完备的大数据集上进行预训练得到监督学习模型第二步交互奖励阶段模型与专业的人工智能训练师进行交互专业标注人员会对ChatGPT生成的回答进行标注评估和反馈给出一个针对回答的分数或者标签这些标注数据可以作为强化学习过程中的奖励函数来指导ChatGPT的参数调整得到奖励模型第三步迭代优化阶段基于奖励模型的奖励函数以PPO一种使用两个神经网络的强化学习算法的方式微调监督学习训练出来的生成模型基于强化学习loss持续迭代生成模型最终帮助模型进行强化学习和不断优化敬请参阅最后一页特别声明10行业深度研究深度图表14OpenAI开展RLHF三步骤来源数字时氪转引自OpenAI国金证券研究所22场景需求预训练阶段高质量专业数据集交互奖励阶段人工智能训练师伴随业界大模型市场竞争的白热化RLHF系统也将得到进一步的推广及迭代使用从而带来两大类新兴数据标注需求一是预训练阶段催生AI厂商对于标注完善清洗完备的各类专业化场景数据集的需求二是交互奖励阶段催生AI厂商对于具备专业的事实判断与规范的价值判断的人工智能训练师的需求目前上述两类新兴需求尚未得到充分有效的市场供给利好海天瑞声这类优质专业数据解决方案提供商针对RLHF预训练阶段需求由于传统数据采标厂商的主流商业模式以销售工具系统和标注服务为主所以普遍缺少自有数据较少经营出售精准数据集的服务针对RLHF交互奖励阶段需求聚焦专业垂类的模型训练师则更为稀缺市场蓝海亟待业务开拓敬请参阅最后一页特别声明11行业深度研究深度图表15RLHF需求预训练阶段高质量专业数据集交互奖励阶段人工智能训练师来源数字时氪转引自OpenAI海天瑞声公司官网国金证券研究所23场景价值超大规模预训练模型推动训练数据指数级跃升市场需求持续延展超大规模预训练模型推动训练数据指数级跃升自OpenAI于2020年推出GPT-3以来谷歌华为智源研究院中科院阿里巴巴等企业和研究机构相继推出超大规模预训练模型包括SwitchTransformerDALLEMT-NLG盘古悟道20紫东太初和M6等目前预训练模型参数数量训练数据规模按照300倍年的趋势增长继续通过增大模型和增加训练数据仍是短期内主流演进方向RLHF技术的推广使用或将推动训练数据市场需求持续延展图表16超大规模预训练模型参数及数据规模近年来指数级跃升来源中国信通院人工智能白皮书2022年国金证券研究所31场景特质自动驾驶客户需求全栈式闭环数据解决方案自动驾驶场景对于AI数据服务需求较为刚性自动驾驶基础数据主要是道路交通图像障碍物图像车辆行驶环境图像等需求方以科技公司汽车厂商和高精地图厂商为主L3级别以上的自动驾驶系统需对雷达摄像头等传感器采集的点云和图像数据进行抽取处理和融合构建车辆行驶环境为预测和决策做依据目前自动驾驶的视觉技术主要应敬请参阅最后一页特别声明12行业深度研究深度用有监督的深度学习是基于已知变量和因变量推导函数关系的算法模型需要大量的标注数据对模型进行训练和调优近几年汽车厂商在ADAS和自动驾驶方向的投入明显对于数据的采集和标注需求也逐年增加汽车厂商有望成为需求主力图表17自动驾驶场景中的AI基础数据服务需求来源艾瑞咨询2019年中国人工智能基础数据服务行业白皮书国金证券研究所自动驾驶领域对于基础数据服务商提出更高要求业内客户需要全栈式闭环数据解决方案数据获取和处理能力是自动驾驶企业的核心竞争要素之一自动驾驶能力取决于高效的数据闭环和数据的利用效率并能利用大量有效数据训练智能驾驶算法因此自动驾驶客户要求数据服务商能够提供闭环数据解决方案以满足智能驾驶业务数据处理量大数据处理需求迭代频次高等特点专业知识服务经验及准入资质将成为衡量的重要标准图表18自动驾驶客户需求全栈式闭环数据解决方案来源海天瑞声2021年报艾瑞咨询2019年中国人工智能基础数据服务行业白皮书国金证券研究所敬请参阅最后一页特别声明13行业深度研究深度32场景需求自动驾驶领域数据标注分为2D图像标注与3D点云标注自动驾驶领域的数据可分为车载摄像头采集的2D图像数据和激光雷达采集的3D点云数据一般而言低level的自动驾驶技术以2D图像数据为主3D点云标注数据是中高level自动驾驶技术的基础训练数据在自动驾驶领域中发挥着愈发重要的作用3D点云标注数据在自动驾驶领域的应用可以分为两个方面一是基于场景理解和目标检测的实时环境感和处理二是SLAM即时定位与地图构建加强定位2D标注通过精确理解来自可见光摄像头的信息寻找能够创建用于目标物体的可扩展边界框3D点云标注通过识别和跟踪场景中的对象了解汽车前方和周围的场景将点云数据和视频流合并到要标注的场景中视频对象和事件跟踪3D点云标注锁定随时间移动的对象并标注时间事件在多帧视频和LiDar场景中跟踪进入和离开本体中的关注区域的对象如其他汽车和行人在整个视频中无论对象进入和离开视线的频率如何都会保持对其特性的一致理解图表19自动驾驶场景中的AI基础数据服务业务类型来源Appen公司官网BodenAIFotune激光雷达国金证券研究所33场景价值自动驾驶训练数据市场方兴未艾2025年国内市场规模或达25亿元自动驾驶约占我国AI基础数据服务市场规模的352025年市场规模或达25亿元自动驾驶的视觉技术主要应用于有监督的深度学习需要大量的标注数据对模型进行训练和调优目前该领域的数据采集和标注需求已成为AI基础数据服务的主要下游之一据IDC2020年我国自动驾驶领域占AI基础数据服务市场规模的35系第一大下游场景另据艾瑞咨询2025年我国自动驾驶AI基础数据服务市场规模或达249亿元预计1825年CAGR高达232跑赢AI基础数据服务整体增速218敬请参阅最后一页特别声明14行业深度研究深度图表202020年自动驾驶约占AI基础数据服务市场规图表212025年我国自动驾驶AI基础数据服务市场规模的35模或达249亿元金融医疗等其他行业10智能终端15自动驾驶35互联网20AI技术提供商及智能安防20来源IDC国金证券研究所来源艾瑞咨询2019年中国人工智能基础数据服务行业白皮书国金证券研究所41发展趋势品牌商价值效应凸显国内市场集中度持续收敛品牌数据服务商未来将替代中小型供应商成为市场主要供应力量我国AI基础数据服务行业主要市场主体包括需求方自建基础数据团队与基础数据服务商品牌数据服务商中小数据服务商截至2019年中小数据供应商是主要供应力量占比高达47其中百度众包海天瑞声分居top2占比分别为110802019年行业CR5仅为262结合本文12部分分析可知近年间需求端垂直场景及专业化需求凸显业务门槛提高供给端竞争加剧挤压中低端业务利润空间加速市场出清预计当前我国AI基础数据服务行业市场主要以品牌数据供应商与需求方自建团队为主行业龙头逐渐浮出水面中小供应商份额显著下降图表222019年我国AI基础数据服务市场竞争格局图表232019年我国AI基础数据服务市场CR5百度众包需求方自建110团队226海天瑞声80中小数据供应商470标贝科技云测其他738信息和数据堂品牌数据供72应商304来源艾瑞咨询中国AI基础数据服务行业发展报告2020国金证券研来源海天瑞声招股说明书国金证券研究所究所业内品牌数据商包括海外巨头Appen国内领军厂商海天瑞声慧听数据标贝科技等Appen1996年成立于澳大利亚面向机器学习和人工智能开发的高质量人工标注数据集于2015年1月于澳大利亚证券交易所上市Appen在采集并丰富语音文字图像和视频等各种数据类型上积累多年经验与全球技术汽车和电子商务公司以及政府部门建立了合作海天瑞声成立于2005年是国内领先的训练数据提供商主要从事训练数据的研发设计生产及销售业务目前已成为同时具备核心技术产品资源优质客户为一敬请参阅最后一页特别声明15行业深度研究深度体的本土训练数据提供企业核心收入来源为数据资源定制服务慧听科技成立于2011年业务包括语音识别语音合成语音评测语言文本类多媒体类等多领域数据制作以及语音合成语音识别输入法系统的研发等公司提供服务涵盖语音训练数据制作音乐数据制作标注语音质量评测等经营模式包括定制开发和自有训练数据产品销售标贝科技成立于2016年主要提供智能语音交互相关服务包括语音合成整体解决方案以及语音合成语音识别图像识别等数据服务经营模式包括定制开发和自有训练数据产品销售图表24业内主要品牌数据商来源海天瑞声招股说明书国金证券研究所42竞争格局业内主要玩家发展各有侧重Appen及海天瑞声具备领先优势据IDC2021年海天瑞声在国内AI基础数据服务行业市占率高达129位居第一其技术实力语种方言覆盖能力专利及软著数量成品训练集数量均位居行业前列相比之下Appen在覆盖区域语种方言覆盖能力等方面更具优势慧听科技与标贝科技则在音乐领域具备差异化业务覆盖能力图表25业内主要玩家指标对比海天瑞声Appen慧听科技标贝科技AI基础数据服务行业第国内市场占有率二名市场占有率为1292021年IDC数据拥有语音合成模型和算海天瑞声自主开发了一体Appen拥有人工智能辅助法通过算法专业的人工化数据处理支撑平台在数据注释平台在全球采用全程质量监控流程数据处理方式为客户提基础研究平台工具训170多个国家与100多执行完善的标注流程配供优质的语音合成服务技术实力概述练数据生产三个维度下均万名专业承包商合作训合保密管理手段提供质拥有TOBI标注体系通积累核心技术将多项具练数据涵盖科技汽车量上乘的数据服务过自主研发的TTS评测体核心技术整合为发行人金融服务零售医疗健20余个系统为客户提供高质量特有的核心技术体系康和政府等各个领域的数据服务语种方言190余个超过235个20余个10余个覆盖能力智能语音计算机视觉智能语音计算机视觉智能语音计算机视觉智能语音计算机视觉应用领域覆盖自然语言自然语言自然语言音乐自然语言音乐敬请参阅最后一页特别声明16行业深度研究深度26项24项发明专利1已获得专利授权项实用新型专利及1项1项4项外观设计专利计算机软件著作159项14项30项权数量拥有的成品训练1054个291个45个179个数据集数量来源海天瑞声招股说明书年报国金证券研究所注Appen慧听科技标贝科技数据截至2021年12月31日海天瑞声数据除特别标注外均为截至2022年6月30日在语音类数据产品中海天瑞声在结构方面的差异主要体现在覆盖的噪声类型录音通道数量录音文本内容类型等方面相比之下海天瑞声的训练数据产品结构整体而言可覆盖更丰富的录音文本内容类型噪音环境类型录音通道数量Appen则在稀有语言覆盖数量上更胜一筹图表26智能语音类训练数据产品对比训练数据集结构属性海天瑞声Appen慧听科技标贝科技数量5791551986覆盖语种方言数量108921910录音场景类别9742采集设备种类10452采集通道覆盖数6441来源海天瑞声招股说明书国金证券研究所图表27通用语音识别训练数据产品对比训练数据集结构属性海天瑞声Appen慧听科技标贝科技一训练数据产品覆盖的1-18类不等110类不等13类不等1类文本类型数量拼读词命令词数字串数字串自然数字符串拼读词命令词数字串自然数时间日期人人命地名企业名命令命令短语普通短语日文本类型自然数时间日期人名地名歌曲名机构词申请词拼音词时常短句名地名歌曲名等名长句等间日期长句等单一训练数据产品覆盖16161413的噪声环境类别数量车内办公室家庭医办公室家庭街边车办公室宿舍家餐厅咖噪声环境类型院地铁游戏场餐厅安静室内车载录音棚内公共场所录音棚啡厅街道车载咖啡厅商场街道单一训练数据产品覆盖1615161的录音通道数量来源海天瑞声招股说明书国金证券研究所敬请参阅最后一页特别声明17行业深度研究深度图表28车载语音识别训练数据产品对比训练数据集结构属性海天瑞声Appen慧听科技标贝科技文本内容类型总数55836数字串街道名称控制数字自然数街道名称导航找音乐城市导航词地名命令词英语通用指令和特定指令字机车系统控制查火车文本内容类型示例数字串时间日期度母串地点企业名称查酒店查餐厅查地铁量衡长句自然口语等自然语句等路况查询等各训练数据产品覆盖7257的噪声环境类别数量怠速低速低速噪音高速路况低速路况停怠速低速低速噪音覆盖车载噪声环境具高速高速噪音城市道怠速高速车待机车窗打开车窗高速高速噪音城市道体类别路城市道路关闭路城市道路噪音噪音各训练数据产品覆盖4541的录音通道数量来源海天瑞声招股说明书国金证券研究所图表29特色语音识别训练数据产品对比训练数据结构属性海天瑞声Appen慧听科技标贝科技稀有语言覆盖数量334100来源海天瑞声招股说明书国金证券研究所在自然语言训练数据产品中不同自然语言训练数据产品的结构差异主要体现在文本来源内容标注属性等方面Appen具备更为丰富的产品数量与更为全面的语言覆盖能力海天瑞声在上述指标上紧随其后图表30自然语言训练数据产品对比1401301191201011008060524020102250海天瑞声Appen慧听科技标贝科技数量覆盖语种方言数量来源海天瑞声招股说明书国金证券研究所在计算机视觉训练数据产品中海天瑞声在结构方面的差异主要体现在人像识别检测相关数据产品领域主要玩家均可覆盖不同类型的人脸姿势场景等因计算机视觉数据产品个性化特征较强各类训练数据产品在具体的人脸类型姿势范围场景等方面具备一定差异与Appen相比海天瑞声的OCR训练数据产品可覆盖更多语种的光学字符识别需要具备广泛性强适用性特征敬请参阅最后一页特别声明18行业深度研究深度图表31计算机视觉训练数据产品结构对比训练数据结构属性海天瑞声Appen慧听科技包含了约3万不同人脸数据覆包含2万张人物轮廓图片覆盖包含1万多张黑人在不同角度和盖黑白黄棕等不同肤色覆不同年龄段男女老少各类着装打人像识别检测相关光线下的人脸图片以及1000名盖闸机口安检库手机拍照库人扮各类行动姿势站立行走中国人身体动作视频等物表情库等应用场景蹲坐等包含中文泰语芬兰语3个语覆盖10余个语种覆盖菜单路OCR光学字符识别种覆盖书籍报刊门票路牌牌收据书籍等17类不同场景菜单等16个不同场景来源海天瑞声招股说明书国金证券研究所43他山之石Appen发展复盘全球AI基础数据服务巨头的崛起之路Appen系AI基础数据服务行业全球巨头经历爆发式成长后收入利润短期双双回落Appen成立于1996年面向机器学习和人工智能开发的高质量人工标注数据集于2015年于澳大利亚证券交易所上市20152019年公司经历了爆发式成长期营收增速一度冲高至100以上同期净利率接近1020202022年受到全球疫情及公司内生发展阶段调整影响2022年公司营收规模相较2021年回落131净利率由91回落至59图表32AI基础数据服务巨头近五年营收CAGR达272来源WindAppen公司官网公司年报晨哨并购国金证券研究所Appen业务类型齐全客户质量较高Appen主要业务类型包括数据采集数据预处理与模型评价三大类其中数据采集环节基于公司预先标记完备的海量数据集为下游客户提供大量其所需的高质量数据数据集语种覆盖范围领先优势较大数据预处理环节公司具备全类型数据标注能力模型评价环节公司通过用户测试及针对客户竞争对手的性能基准测试诊断模型潜在问题并为此提供能够优化模型的训练数据公司主要客户质量较高包括GoogleAmazonMicrosoft等知名IT巨头敬请参阅最后一页特别声明19行业深度研究深度图表33Appen业务类型齐全客户质量较高来源Appen投资者关系材料国金证券研究所Appen位居同业员工量能及数据标注技术前列全球范围来看Appen位居全球AI基础数据服务行业收入体量首位其员工量能数量及质量与数据标注技术领先程度均位居行业头部紧随之后的是Telus和Lionbrigde以数据堂海天瑞声为代表的国内头部厂商距离Appen等海外大厂仍存在一定差距图表34Appen处于员工量能及标注技术矩阵头部位置来源Appen投资者关系材料国金证券研究所AI基础数据服务行业需求侧AI垂直场景及专业化需求凸显数据需求量提升但数据采标业务门槛提高供给端国内数据安全标准及相关资质要求提升相关解决能力向头部厂商聚集推荐关注国内业内领军海天瑞声敬请参阅最后一页特别声明20
|
相关研报
|
||||||||||||||||||||||
