灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
9月13日 09:22
信源:
X:马东锡 NLP (@dongxi_nlp)
· 👁️ 38707 次研读
LLM 为何缓存 K 和 V 却不缓存 Q
💡 灵机 AI 深度洞见与核心提炼
这篇长文解释 LLM 推理中 KV cache 的原理:每生成一个 token,历史位置的 K/V 会被保留供后续位置读取,而 Q 随新位置重新产生,用完即可丢弃。
信源媒体:
X:马东锡 NLP (@dongxi_nlp)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅