>> 浙商证券-AI前沿跟踪系列(三):智能配置点评基于人类反馈的强化学习与RLAIF-231021
| 上传日期: |
2023/10/22 |
大小: |
813KB |
| 格式: |
pdf 共10页 |
来源: |
浙商证券 |
| 评级: |
-- |
作者: |
陈冀 |
| 下载权限: |
此报告为加密报告 |
|
|
核心观点 基于人类反馈的强化学习在ChatGPT3.5之后引起极大关注,然而RLHF方法存在扩展的困难,需要高质量的人类标注。Harrison等人探索了AI替代人类反馈的可能性。研究表明至少在“摘要”偏好方面,RLAIF和RLHF取得了相当的效果,均优于SFT。 RLHF需要高质量人类标注 使用强化学习训练的语言模型可以在复杂的序列级目标上进行优化,而这些目标往往不容易通过传统的监督微调方法进行区分。然而,RLHF的扩展面临一个困难,即需要高质量的人类标签。因此,Harrison Lee et al.探讨了是否可以使用AI生成的标签来取得类似的结果。 RLHF与RLAIF对比评估 RLAIF是否能够替代RLHF,Harrison等人采用三个指标:AI标签对齐度,两两准确性和胜率来进行评估。 RLHF与RLAIF在摘要偏好上性能接近 RLAIF的表现与RLHF相似,但RLHF略优于RLAIF,但差异并没有统计学意义。在人类评估员看来,两种策略都优于基线SFT策略,其中RLHF被优选的比例为73%,RLAIF为71%。 风险提示 本报告依据最新前沿论文进行解读评述,若有理解不当请以原始论文表述为准。且本报告为AI应用方法和框架介绍,并不作为有效投资方法建议,仅供参考
|
|