transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp
💡 灵机 AI 深度洞见与核心提炼
Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。
信源媒体:Hugging Face:Blog(RSS)
访问出处网页 ↗