BaseRT:苹果芯片原生推理引擎,大模型性能提升超50%

arXiv·19 天前

近日,研究团队在arXiv发布论文《BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal》,提出专为苹果芯片优化的原生Metal推理运行时。该方案针对现有框架在苹果统一内存架构上的性能瓶颈,通过芯片级内核融合、内存感知优化和自定义调度逻辑,显著提升大语言模型在苹果设备上的推理效率。

BaseRT支持从Q2到FP16共八种量化格式,兼容所有M系列芯片设备。在M3和M4 Pro设备上的测试显示,该方案在Qwen3、Llama 3.2和Gemma 4等模型上表现突出:相比llama.cpp最高提升1.56倍解码吞吐量,相比MLX框架最高提升1.35倍。特别是在专家混合模型的前向填充阶段,性能优势更为明显,从10亿到300亿参数模型均保持领先性能。

这项研究重新定义了苹果芯片作为AI推理平台的潜力。随着隐私保护、延迟要求和云端成本压力推动AI推理向边缘设备转移,高性能本地运行时成为关键支撑技术。BaseRT已开源发布,为开发者在苹果生态中部署高效AI应用提供了新工具。

推理优化苹果芯片边缘计算大语言模型开源工具

原文来源:https://arxiv.org/abs/2607.00501

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回