DPO Direct Preference Optimization,直接偏好优化。 Direct Preference Optimization,直接偏好优化。RLHF 的简化版——不需要单独训一个奖励模型,直接用人类偏好数据来优化语言模型本身。效果接近 RLHF 但流程更简单、成本更低,现在很多团队已经用 DPO 替代 RLHF。 什么时候会用到讨论模型训练技术路线选择时会用。 例句 我们团队就 3 个人,搞不了 RLHF 那套,直接用 DPO,性价比更高。 相关词 RLHF偏好数据