研究团队为 macOS 虚拟机中的 Metal 能力查询构建了进程级兼容层,使 llama.cpp 能够选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍,token 生成速度提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍 LLM 推理加速
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,让 llama.cpp 使用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 提示处理提升 11.08 倍、生成提升 16.36 倍,接近裸机 98%;Gemma 4 12B 分别提升 7.20 倍和 14.54 倍。
该成果有助于 FDE 在 macOS 虚拟机中获得接近裸机的 LLM 推理性能,适合在受控或虚拟化客户环境中部署 AI Agent 和本地推理服务,提升交付灵活性与响应速度。