llama.cpp 支持 Qwen3.8-27B DFlash 加速
💡 灵机 AI 深度洞见与核心提炼
如果你在使用 Qwen3.8-27B + MTP,请务必升级到 DFlash 以获得额外加速:
llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7
需要最新的 llama.cpp v0.6.0
信源媒体:X:Georgi Gerganov(llama.cpp) (@ggerganov)
访问出处网页 ↗