Speculative Decoding投机解码 用一个快速的小模型先猜大模型可能输出什么,然后让大模型验证。 用一个快速的小模型先猜大模型可能输出什么,然后让大模型验证。猜对了就直接用(省了大模型计算时间),猜错了再用大模型重新生成。能加速推理 2-3 倍且不损失质量。 什么时候会用到讨论推理加速方案时会用。 例句 上了 Speculative Decoding 之后,TTFT 没变但整体生成速度快了 2 倍。 相关词 大模型推理