Latency延迟
从发出请求到收到完整回复的总时间。
从发出请求到收到完整回复的总时间。包括网络传输、排队等待、模型推理等各个环节。AI产品的延迟通常在 1-30 秒不等,取决于模型大小和回复长度。
什么时候会用到
讨论性能体验、技术方案对比时会用。
例句
- 端到端延迟 8 秒太长了,用户等不了。看看能不能切小模型或者做缓存。
从发出请求到收到完整回复的总时间。
从发出请求到收到完整回复的总时间。包括网络传输、排队等待、模型推理等各个环节。AI产品的延迟通常在 1-30 秒不等,取决于模型大小和回复长度。
讨论性能体验、技术方案对比时会用。