vLLM 维护者实测 TPUv7 经 megakernel 优化后 Kimi K3 单用户达 700 tok/s,高出 GB200 NVL72 56%
💡 灵机 AI 深度洞见与核心提炼
vLLM 维护者展示 TPUv7 经 megakernel 优化后在 Kimi K3 上达到 700 tok/s/user,比 NVIDIA GB200 NVL72 高 56%。图表显示 16× TPU v7 为 709 tokens/s,16× GB200 vLLM baseline 为 452 tokens/s。SemiAnalysis 称 TPU 软件外部化进展值得持续关注。
信源媒体:X:SemiAnalysis (@SemiAnalysis_)
访问出处网页 ↗