NVIDIA 技术博客解析 Dense 与 MoE 模型的激活参数、吞吐差异及选型方法

💡 灵机 AI 深度洞见与核心提炼
NVIDIA 技术博客讲解 dense 与 MoE 两种架构的参数使用差异:MoE 通过 router 网络在每个 token 只激活部分 FFN 专家,30B 总参数的 Nemotron 3.5 Lightning 每 token 仅激活 3B。
信源媒体:NVIDIA Technical Blog:Agentic AI / Generative AI
访问出处网页 ↗