文章总结: 本文揭示苹果M4/M5芯片SME引擎因多核共享执行资源存在侧信道漏洞。攻击者利用指令争用致CPI变化构建缓存无关隐蔽信道,实现超1Mbps跨核通信、近99%的DNN模型识别率及13小时内恢复后量子密钥。建议通过时间复用、资源划分或噪声注入兼顾性能与跨域安全。 综合评分: 93 文章分类: 漏洞分析,逆向分析,漏洞POC,终端安全,AI安全
骑士战队 MICRO’26 论文之 Apple 篇 —— SMExplode:基于苹果 SME Engine 构建的缓存无关跨核侧信道攻击
骑士战队 骑士战队
安全硬核
2026年7月20日 09:47 北京
在小说阅读器读本章
去阅读
第 59 届 IEEE/ACM 国际微体系结构会议(MICRO 2026)定于 2026 年 10 月 31 日至 11 月 4 日在希腊雅典举行,骑士战队共有 4 篇论文被接收。
本文 SMExplode首次系统分析了 Apple M4/M5 中的 Scalable Matrix Extension(SME)Engine,并利用这一共享加速器上的指令争用,构造出不以缓存为观测媒介的跨核、跨虚拟机高精度侧信道。
论文题目:SMExplode: Cross-Core and Cache-Agnostic Side-Channel Attack on Apple Silicon via SME Engine
作者:Hongpei Zheng, Ben Chen, Hanyin Liu, Kaiyuan Rong, Yun Chen, Dongsheng Wang
会议:MICRO 2026
Part1
核心要点
SMExplode 的关键发现是:同一 Cluster 内的多个 CPU 核心共享一个 SME Engine。当不同核心同时执行 SME 指令时,它们会竞争后端执行资源,使指令 CPI 产生稳定、可测的变化。攻击者在另一个核心持续执行并计时一组 SME 指令,即可实时细粒度感知受害者的 SME 活动;这一过程使用普通用户态计时,不读取受害者地址空间,也不依赖缓存状态。
基于这一发现,SMExplode 实现最高 1.223 Mbps 的跨核隐蔽信道和0.695 Mbps 的跨虚拟机隐蔽信道;对 8 种 DNN 模型的识别准确率达到98.53%,并能泄漏模型结构和卷积算子规模;针对 SME 加速的 OpenSSL ML-DSA-44 实现,完整密钥可在约 13 小时内恢复。
Part2
背景与问题
以往针对 Apple 芯片的微架构攻击,多集中于同一进程中的预取器、预测机制,或依赖缓存完成跨核观测。自 M4/A18 起进入 Apple 芯片的 SME Engine 面向向量和矩阵运算,是 AI/ML 与密码算法的重要加速部件。每个 CPU 核心保留独立的 SME 架构状态,但同一 Cluster 内的核心共享一个包含 Decode、Map、Schedule 和多类执行单元的 SME Engine,这一组织方式也引入了新的跨核心共享边界。
图 1. Apple SME Engine 与 CPU Core、共享 L2 Cache 的交互概览。
Part3
核心发现
研究团队通过不同依赖关系和并行度的指令序列,对 M4/M5 的 SME Engine 进行了逆向。结果表明,SME 内部存在对应 SSVE、SSFP 和矩阵运算的多类执行资源,P-Core 与 E-Core Cluster 的矩阵资源配置也有所不同。更重要的是,当两个核心同时使用 SME 时,一方的指令会显著延迟另一方:不同指令类型具有不同的干扰强度,争用信号还能随工作负载规模变化。实验中,Sampler 以约100 ns的节奏采样;即使另一核心仅突发执行 5 条 SSVE ADD,CPI 变化也可被检测。相同现象在基于 Apple Virtualization.Framework 的虚拟机中依然存在,说明 SME 共享没有止步于进程或物理核心边界。
图 2. 另一核心突发执行不同数量的 SSVE ADD 时,Sampler 捕获到分级 CPI 波动。
Part4
攻击原语
SMExplode 的攻击原语包含“占满”和“检测”两个动作:攻击者以较高指令级并行度持续占用某类 SME 执行单元,同时反复测量自身指令序列的耗时;受害者在另一核心调用相关 SME 资源后,竞争会直接体现为攻击者 CPI 上升。该原语针对的是共享执行资源的实时争用,而不是受害者执行后留在缓存、TLB 或预测器中的持久化痕迹,因此能够避开以缓存状态为核心的观测与防护假设。
Part5
跨核与跨虚拟机隐蔽信道
在隐蔽信道中,发送端分别用“执行 SME 指令”和“只执行 CPU 指令”制造有争用、无争用两种状态,接收端则连续测量 SME 指令 CPI 并还原比特。为降低无同步传输中的错位,SMExplode 使用冗余编码和周期性对齐序列;跨虚拟机时再把长消息切分为 4096-bit 数据块,以减小 VM 调度抖动的影响。
图 3. 发送端通过 SME 争用编码信息,接收端采样 CPI 并完成译码。
在默认用户态 Mach timer 下,M4 P-Core 的跨核信道达到1.090 Mbps、99.05% 准确率,M5 P-Core 达到1.223 Mbps、97.27%;跨 VM 时,M4 与 M5 分别达到0.455 Mbps、97.44% 和0.695 Mbps、97.73%。
图 4. SMExplode 跨核与跨虚拟机隐蔽信道的带宽和准确率。
Part6
DNN 模型信息泄漏
Apple Accelerate 和 Core ML 中的模型会调用 SME 优化算子,不同网络因算子类型、执行顺序和计算规模不同,留下具有模型特征的争用轨迹。团队使用跨核采样数据训练轻量级分类器,在 ResNet18/34/50、EfficientNetB4、VGG16、DenseNetBC、SqueezeNet 和 MobileNetV2 上取得98.53% 的识别准确率。轨迹还可以进一步显示 ResNet50 的 Epoch、Bottleneck 数量与 Conv/ReLU/FC 执行顺序,并与卷积核、通道数和计算规模呈高度相关。黑盒 Core ML 推理及 VM 内卷积层 PoC 也产生了可区分信号,说明泄漏能够延伸到真实系统框架和虚拟化场景。
图 5. 不同 DNN 模型产生的采样密度与 CPI 轨迹。
图 6. DNN 网络指纹识别流程。
图 7. ResNet50 的 Epoch 和层级采样信息。
Part7
后量子密码密钥恢复
SMExplode 还被用于攻击 OpenSSL 中启用 SME 加速的 ML-DSA-44 签名。该实现的拒绝采样过程会根据中间结果走向不同分支,进而执行不同数量的向量与矩阵操作;这些差异会在另一个核心的 SME 争用轨迹中表现出来。攻击者通过大量签名请求收集轨迹和签名输出,再结合分类与格规约恢复秘密向量。实验共收集 108 组签名及轨迹,在线采集约 7 小时、离线计算约 6 小时,最终在约 13 小时后恢复完整密钥。该泄漏来自 SME 资源共享,并非 ML-DSA 标准本身的数学设计。
图 8. 不同拒绝采样分支对应可区分的 SME 争用片段。
Part8
总结与缓解
SMExplode 揭示了 Apple Silicon 上一个此前较少受到关注的安全边界:即使 CPU 没有传统 SMT,同一 Cluster 共享的专用加速器后端仍会把多个物理核心、进程和虚拟机连接到同一套执行资源。论文讨论的缓解方向包括按安全域对 SME 做时间复用、静态划分执行资源、为密码等关键进程临时授予独占访问,以及在短敏感区间注入随机 SME 噪声。更根本的启示是,随着 AI、矩阵和密码计算不断迁移到专用加速器,共享资源的性能优化需要与跨核心、跨进程、跨 VM 的安全隔离同步设计。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全硬核 骑士战队 骑士战队《骑士战队 MICRO’26 论文之 Apple 篇 —— SMExplode:基于苹果 SME Engine 构建的缓存无关跨核侧信道攻击》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论