Latency延迟

从发出请求到收到完整回复的总时间。

从发出请求到收到完整回复的总时间。包括网络传输、排队等待、模型推理等各个环节。AI产品的延迟通常在 1-30 秒不等,取决于模型大小和回复长度。

什么时候会用到

讨论性能体验、技术方案对比时会用。

例句

  • 端到端延迟 8 秒太长了,用户等不了。看看能不能切小模型或者做缓存。

相关词