DPO

Direct Preference Optimization,直接偏好优化。

Direct Preference Optimization,直接偏好优化。RLHF 的简化版——不需要单独训一个奖励模型,直接用人类偏好数据来优化语言模型本身。效果接近 RLHF 但流程更简单、成本更低,现在很多团队已经用 DPO 替代 RLHF。

什么时候会用到

讨论模型训练技术路线选择时会用。

例句

  • 我们团队就 3 个人,搞不了 RLHF 那套,直接用 DPO,性价比更高。

相关词