Prefill、KV cache 与 Prefix caching 三概念解析
💡 灵机 AI 深度洞见与核心提炼
马东锡 NLP 用文档+LLM 办公场景解释三个概念:Prefill 处理 input,KV cache 保存计算得到的 K/V 供后续生成使用,Prefix caching 在输入变化时只能复用首次 token 变化之前的共同 prefix。以 A、B、C 三轮文档问答为例,C 的输入方案已改变,因此无法完整复用前序缓存。
信源媒体:X:马东锡 NLP (@dongxi_nlp)
访问出处网页 ↗