KV Cache
Key-Value Cache,在推理过程中缓存已经计算过的中间结果,避免重复计算。
Key-Value Cache,在推理过程中缓存已经计算过的中间结果,避免重复计算。是加速长文本生成的核心技术——没有 KV Cache,模型每生成一个新字都要重新"看"一遍整篇上下文。
什么时候会用到
讨论推理性能优化、长上下文处理时会用。
例句
- 上下文太长 KV Cache 爆显存了,得做 KV Cache 压缩或者分页管理。
Key-Value Cache,在推理过程中缓存已经计算过的中间结果,避免重复计算。
Key-Value Cache,在推理过程中缓存已经计算过的中间结果,避免重复计算。是加速长文本生成的核心技术——没有 KV Cache,模型每生成一个新字都要重新"看"一遍整篇上下文。
讨论推理性能优化、长上下文处理时会用。