LLM 推理性能核心框架:Prefill 拼算力,Decode 拼带宽,KV 缓存决定显存代价
💡 灵机 AI 深度洞见与核心提炼
作者整理了 llama.app 的推理概念文档(https://llama.app/docs/prefill-vs-decode),提出核心框架:Prefill 阶段并行读入 prompt、瓶颈在算力,Decode 阶段逐 token 自回归、瓶颈在内存带宽。
信源媒体:X:邵猛 (@shao__meng)
访问出处网页 ↗