llama.cpp 支持通过 ggml RPC 后端在异构设备上分布式推理
💡 灵机 AI 深度洞见与核心提炼
llama.cpp 可通过 ggml RPC 后端在异构设备间分布式推理,作者 Georgi Gerganov 表示这是高级设置,后续会让普通用户更容易使用。被引用的实测称,MiMo 2.6 Flash 的原生 mxfp4 权重可跨 RTX 6000 GPU 与 M5 笔记本以 40 tokens/sec 通过 10 GbE 运行,llama.cpp 开箱即支持。
信源媒体:X:Georgi Gerganov(llama.cpp) (@ggerganov)
访问出处网页 ↗