【第656期】基于Llama 3模型的全同态加密隐私保护推理Seventy3

【第656期】基于Llama 3模型的全同态加密隐私保护推理

20分钟 ·
播放数7
·
评论数0

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。

如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。
合作邮箱:zhiwudazhanjiangshi#gmail.com

今天的主题是:

Fully Homomorphic Encryption on Llama 3 model for privacy preserving LLM inference

Summary

生成式人工智能(Generative Artificial Intelligence,GenAI)的广泛应用,以及其与医疗、金融、交通运输和信息安全等数据驱动领域的深度融合,显著提升了服务效率并降低了响应延迟。然而,这种融合也引发了关于大型语言模型(LLMs)安全性及其对企业和用户数据隐私影响的严重担忧。

许多科技公司在其服务中集成了具备一定自主决策能力的大语言模型,但由于 LLM 推理流水线(LLM pipeline)存在安全隐患,面临数据泄露和机密信息泄露的风险,使其容易遭受多种攻击,包括数据投毒(data poisoning)、**提示注入(prompt injection)模型窃取(model theft)**等。

尽管目前已经采用了多种安全技术来降低这些风险,例如输入/输出净化(input/output sanitization)去中心化学习(decentralized learning)访问控制管理(access control management)以及加密技术(encryption),但量子计算攻击仍构成迫在眉睫的威胁。预计未来的量子计算能力将能够破解现有加密算法,从而恢复密钥、获取加密的敏感数据,并解密经过加密保护的模型。

在本文中,我们将基于**后量子密码学(Post-Quantum Cryptography,PQC)格密码同态加密(Lattice-based Homomorphic Encryption,HE)**核心功能集成到大语言模型的推理流水线中,以保护其中部分网络层免受数据隐私攻击。

具体而言,我们对 LLaMA-3 模型所采用的 Transformer 架构推理流程进行了修改,并引入 concrete-ml 库提供的核心同态加密操作,将其嵌入推理过程。

实验结果表明,在采用**全同态加密(Fully Homomorphic Encryption,FHE)**保护的 LLaMA-3 推理模型上,我们仍然能够获得较高的文本生成准确率(最高可达 98%),同时保持较为合理的推理延迟(在 Intel Core i9 CPU 上约为 237 毫秒),生成速度最高可达 80 token/s。这些结果证明了本文方案在 FHE 保护下运行 LLaMA-3 推理模型的可行性与有效性。

此外,本文还通过进一步的实验与分析,对模型文本生成的延迟特性及其行为表现进行了深入讨论,以解释其性能表现及其背后的原因。

原文链接:arxiv.org