跳到正文
技术吧
返回

AI大脑也能被“套路”?——揭秘大模型的提示词注入攻击

更新于:

什么是提示词注入?

提示词注入指的是攻击者通过精心设计的输入,操纵大型语言模型(LLM),使其偏离预期行为。这种操纵通常被称为“越狱”(Jailbreaking),其目的是诱使LLM执行攻击者的指令。当LLM被集成到内部数据库、API或代码解释器等工具中时,这种攻击变得尤为严重,因为它打开了新的攻击面。

过去,我们对 UI 和 API的访问是基于结构化格式,依赖于可预测的输入。然而,LLM时代的到来,使得系统需要处理前所未有的大量非结构化输入。同时,LLM还能将这些输入传播到内部服务(如 API、数据库、代码执行等),进一步放大了影响范围。换句话说,我们现在不仅需要处理比以往更多的输入,还必须防范它对更多服务的潜在影响。

提示词注入的类型

提示词注入主要分为以下几种类型,技术复杂度各不相同:

1. 直接提示注入

在这种“经典”攻击方式中,系统期望用户输入普通文本提示,但攻击者却设计特殊的提示,诱导LLM偏离原本的设定。例如,攻击者可能会告诉LLM忽略系统的预设指令,而是遵循用户的新指令。这种方式正在变得越来越复杂,因为攻防双方都在不断发展新的 AI 技术。

2. 间接提示注入

在这种方式中,攻击者并不直接输入恶意提示,而是通过第三方数据源(如网页搜索或 API调用)引入恶意指令。例如,在 Bing Chat 这样的LLM具备互联网搜索能力时,用户可以让它访问某个网站。如果该网站包含恶意提示(比如用白色字体隐藏的文本),Bing Chat 可能会无意中读取并执行这些指令。这种攻击的关键点在于,攻击者不是直接向LLM发送指令,而是引导LLM获取被篡改的信息。

3. 视觉提示注入

随着生成式 AI(GenAI)应用发展为多模态系统(支持文本、图像等多种输入),攻击者可以在视觉输入中隐藏恶意指令。例如,攻击者可以在图片中嵌入肉眼不可见的文本,导致LLM被欺骗,给出错误的回答。

在一张图片中隐藏文字,导致 GPT-4 将一只猫误识为狗。

为什么难以阻止提示词注入?

传统的安全防护措施通常依赖于启发式规则、模式匹配、正则表达式和黑名单等方法。然而,LLM的输入是非结构化的,可能包含多种语言、不同的 token 长度,应用场景广泛,用户群体也极为多样。因此,传统的安全检测手段难以适应这种无限变化的输入数据。

目前尚无100%有效的解决方案可以完全防止提示词注入,但可以采取措施提高攻击难度,使攻击者更难以得逞。

提示词注入风险有多大?

取决于具体情况,但提示词注入在网络安全领域的影响力正在不断扩大。

如何防范提示词注入?

结论

在LLM进入生产环境的情况下,没有专门的安全解决方案是很危险的。企业应当采用专门针对提示词注入的安全策略,使攻击者的操作变得极为困难,并确保 AI 安全性与业务需求并行发展。


分享本文:

上一篇
生成式AI正在改变我们的工作和生活
下一篇
模型蒸馏是什么,如何工作的?