LLM 速度体验:TTFT 与 ITL 解析
💡 灵机 AI 深度洞见与核心提炼
LLM 的速度体验分为等待首 token 和回答流畅度两方面,分别与 Prefill 和 Decode 密切相关。从发出请求到收到第一个 token 的等待叫 TTFT,模型在此期间进行 prefill 处理输入;开始回答后通过 decode 逐步生成后续 token,相邻 token 到达间隔叫 ITL。TTFT 越短反应越快,ITL 越短且越稳定回答越流畅。
信源媒体:X:马东锡 NLP (@dongxi_nlp)
访问出处网页 ↗