研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 浙商证券-AI前沿跟踪系列(三):智能配置点评基于人类反馈的强化学习与RLAIF-231021
上传日期:   2023/10/22 大小:   813KB
格式:   pdf  共10页 来源:   浙商证券
评级:   -- 作者:   陈冀
下载权限:   此报告为加密报告
核心观点
  基于人类反馈的强化学习在ChatGPT3.5之后引起极大关注,然而RLHF方法存在扩展的困难,需要高质量的人类标注。Harrison等人探索了AI替代人类反馈的可能性。研究表明至少在“摘要”偏好方面,RLAIF和RLHF取得了相当的效果,均优于SFT。
  RLHF需要高质量人类标注
  使用强化学习训练的语言模型可以在复杂的序列级目标上进行优化,而这些目标往往不容易通过传统的监督微调方法进行区分。然而,RLHF的扩展面临一个困难,即需要高质量的人类标签。因此,Harrison Lee et al.探讨了是否可以使用AI生成的标签来取得类似的结果。
  RLHF与RLAIF对比评估
  RLAIF是否能够替代RLHF,Harrison等人采用三个指标:AI标签对齐度,两两准确性和胜率来进行评估。
  RLHF与RLAIF在摘要偏好上性能接近
  RLAIF的表现与RLHF相似,但RLHF略优于RLAIF,但差异并没有统计学意义。在人类评估员看来,两种策略都优于基线SFT策略,其中RLHF被优选的比例为73%,RLAIF为71%。
  风险提示
  本报告依据最新前沿论文进行解读评述,若有理解不当请以原始论文表述为准。且本报告为AI应用方法和框架介绍,并不作为有效投资方法建议,仅供参考
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1