Preference Data偏好数据 "回答A好还是回答B好"这种人类偏好判断的标注数据,RLHF 和 DPO 的燃料。 "回答A好还是回答B好"这种人类偏好判断的标注数据,RLHF 和 DPO 的燃料。判断哪个好比从零写一个好答案容易,所以收集成本相对低。 什么时候会用到讨论 RLHF/DPO 训练、标注任务设计时会用。 例句 这一轮收集了 5 万条偏好数据做 DPO,模型对话质量提升明显。 相关词 RLHFDPO标注