TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone

📅 2026/8/5 23:08:59
TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone
TZ-LLM 论文总结与核心部分翻译一、文章主要内容本文针对移动设备上部署的大语言模型(LLMs)面临的模型泄露安全风险,提出了一种基于 Arm TrustZone 可信执行环境(TEE)的保护系统 TZ-LLM。该系统旨在解决设备端 LLM 推理过程中的两大核心挑战:内存效率与推理速度的矛盾:LLM 参数量巨大(如 8 位量化的 Llama-3-8B 需 8GB 内存),静态预留安全内存会导致内存利用率低,而动态扩展安全内存则会因内存分配、I/O 读取和解密开销导致首次令牌生成时间(TTFT)过长。REE 与 TEE 间 NPU 高效安全分时共享缺失:NPU 能显著提升 LLM 推理性能(最高 7.3 倍),但现有方案要么将完整 NPU 驱动移植到 TEE 导致可信计算基(TCB)膨胀,要么切换 NPU 时需重新初始化驱动造成高额开销。TZ-LLM 基于 OpenHarmony 操作系统和 llama.cpp 推理框架实现,在 Rockchip 设备上进行验证。实验结果显示,与无优化的 TEE 基准方案相比,该系统将 TTFT 降低 76.1%~90.9%,解码速度提升 0.9%~23.2%;与 REE 优化基准方案相比,TTFT 和解码速度仅产生 5.2%~28.3% 和 1.3%~4.9% 的平均开销,在安全性、性能和内存效率间实现了平衡。二、创新点流水线恢复机制(Pipelined Restora