技巧 信源:X:邵猛 (@shao__meng) · 👁️ 18827 次研读

LLM 推理性能核心框架:Prefill 拼算力,Decode 拼带宽,KV 缓存决定显存代价

💡 灵机 AI 深度洞见与核心提炼
作者整理了 llama.app 的推理概念文档(https://llama.app/docs/prefill-vs-decode),提出核心框架:Prefill 阶段并行读入 prompt、瓶颈在算力,Decode 阶段逐 token 自回归、瓶颈在内存带宽。
信源媒体:X:邵猛 (@shao__meng)
访问出处网页 ↗
阅读原文出处 ↗