RLHF

Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。

Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。SFT 之后的进一步调教:让人类标注员对模型的多个回答排序"哪个更好",然后训练一个奖励模型来打分,最后用强化学习让模型学会生成高分回答。ChatGPT 好用的核心秘密之一。

什么时候会用到

讨论模型质量、对齐安全、标注成本时会用。

例句

  • 光做 SFT 不够,模型还是会说一些离谱的话,得上 RLHF 把它拉回来。
  • RLHF 的瓶颈在标注,养一支高质量标注团队太贵了。

相关词