Distillation蒸馏

用大模型(教师模型)的输出来训练小模型(学生模型),让小模型学到大模型 80-90% 的能力但体积小几十倍。

用大模型(教师模型)的输出来训练小模型(学生模型),让小模型学到大模型 80-90% 的能力但体积小几十倍。核心目的是降低部署成本和推理延迟。很多线上产品跑的其实是蒸馏后的小模型。

什么时候会用到

讨论降本增效、端侧部署、模型上线策略时会用。

例句

  • 线上跑 GPT-4 成本太高,我们用 GPT-4 的输出蒸馏一个 7B 的小模型,效果差不多但成本降 90%。

相关词