信源:X:马东锡 NLP (@dongxi_nlp) · 👁️ 38707 次研读

LLM 为何缓存 K 和 V 却不缓存 Q

💡 灵机 AI 深度洞见与核心提炼
这篇长文解释 LLM 推理中 KV cache 的原理:每生成一个 token,历史位置的 K/V 会被保留供后续位置读取,而 Q 随新位置重新产生,用完即可丢弃。
信源媒体:X:马东锡 NLP (@dongxi_nlp)
访问出处网页 ↗
阅读原文出处 ↗