首页 / 大模型动态

Hugging Face 为 Transformers 加入 GGUF 加载路径,Qwen 模型可在 Apple Silicon 本地运行

Hugging Face 宣布 Transformers 可高效加载 GGUF 量化模型,首批聚焦 Apple Silicon 与 Qwen3.5 架构,并复用 ggml 内核。

今日科技圈头条C编辑部已完成来源核验
查看行业与公司影响↓

Hugging Face 于9月22日宣布,Transformers 新增高效运行 GGUF 模型的支持,使开发者可通过既有 Transformers 接口加载量化检查点。GGUF 是 llama.cpp 生态常用的模型权重与元数据封装格式。

该项目当前首先聚焦 Apple Silicon 本地推理,并以 Qwen3.5 架构作为起点。Hugging Face 表示,新路径会复用 ggml 的量化、注意力与归一化等内核;若兼容内核无法取得,加载流程会回退到标准 SDPA 注意力实现,并提示可能增加内存使用。

官方说明称,同一检查点可继续通过 Transformers 的服务接口暴露兼容 OpenAI 风格的本地端点。Hugging Face 也强调,其测试与 llama.cpp 的计量口径不同:前者包含预填充,后者的基准侧重解码速率,因此不能将相关数字直接视为完全等价的性能比较。

统一加载接口有助于降低量化模型的试用摩擦

GGUF 支持把量化权重带入熟悉的 PyTorch 与 Transformers 工作流,可能减少团队在本地评估、模型转换验证和原型开发时切换工具链的成本。对于希望在已有 Python 代码中测试开放权重模型的开发者,这种兼容性尤其有用;而以极致本地推理效率为首要目标的场景,Hugging Face 仍将 llama.cpp 定位为专用运行时。实际部署不能只看文件体积缩小:量化级别会影响内存占用与输出表现,Apple Silicon 支持范围、内核版本和预填充延迟也会影响体验。企业若把该路径用于生产,还需要按自己的模型、提示词和并发条件完成质量与性能验证。

涉及行业行业影响分析简要理由
应用软件中性开放权重模型多了一条本地测试与服务化路径,但效果依赖具体模型和硬件。
系统软件利好Transformers 与 ggml 内核的衔接扩展了量化模型的运行方式。
IT咨询与其他服务中性本地部署项目仍需完成量化选择、兼容性与性能验证。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

进一步了解

从报道到选型

相关报道

专题:AI模型与技术

#Hugging Face#Transformers#Qwen#本地部署#GGUF