使用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

💡 灵机 AI 深度洞见与核心提炼
NVIDIA 介绍如何用 Transformer Engine 配合 JAX 优化 dropless MoE 训练。在 GB200 上训练 DeepSeek-V3 时,未优化基线仅 103 TFLOPS/GPU、GPU 间通信占内核时间 84%,经内核优化后提升至 1,068 TFLOPS/GPU,达 10.4 倍。
信源媒体:NVIDIA Technical Blog:Agentic AI / Generative AI
访问出处网页 ↗