SFT监督微调

Supervised Fine-Tuning。

Supervised Fine-Tuning。预训练完的模型像个"什么都知道但不会好好说话"的人,SFT 就是用人工标注的高质量问答对来教它"怎么正确回答问题"。比如给它看几万条"用户问→标准答案"的示例,让它学会对话的格式和规范。

什么时候会用到

讨论模型效果优化、标注团队投入、私有化部署时会用。

例句

  • 通用模型在我们金融场景下表现不行,得准备一批行业 QA 数据做 SFT。
  • SFT 数据不在多,在精。一千条高质量数据比一万条垃圾数据效果好。

相关词