Preference Data偏好数据

"回答A好还是回答B好"这种人类偏好判断的标注数据,RLHF 和 DPO 的燃料。

"回答A好还是回答B好"这种人类偏好判断的标注数据,RLHF 和 DPO 的燃料。判断哪个好比从零写一个好答案容易,所以收集成本相对低。

什么时候会用到

讨论 RLHF/DPO 训练、标注任务设计时会用。

例句

  • 这一轮收集了 5 万条偏好数据做 DPO,模型对话质量提升明显。

相关词