给图片加一点肉眼看不见的噪声,模型就可能认错;换一种问法,模型就可能绕过限制。本文解释对抗样本与越狱攻击各自的原理、两者的区别,以及常见的防御思路与它们各自的能力边界。

核心要点

  • 对抗样本利用模型决策边界的脆弱性,用微小扰动改变结果
  • 越狱攻击通过改写指令诱导模型绕过其安全策略
  • 防御通常是持续对抗过程,不存在一劳永逸的方案

看不见的扰动

研究人员发现,在一张被正确识别为熊猫的图片上,加上一层经过精心计算、人眼几乎察觉不到的噪声,模型可能以很高的置信度把它判成长臂猿。这类被刻意构造的输入称为对抗样本。它之所以成立,是因为模型的决策边界在高维空间中非常复杂,沿着某些方向微小移动就足以跨越边界。

更值得注意的是对抗样本的迁移性:针对一个模型构造的扰动,有时也能骗过另一个结构不同的模型。这说明脆弱性并非某个模型的偶然缺陷,而与当前主流训练方式本身有关。在自动驾驶识别路牌、验证码识别等场景中,这种脆弱性具有现实的安全意义。

越狱:换个说法绕过限制

越狱(jailbreak)指的是用户通过改写提问方式,诱导模型输出其本应拒绝的内容。常见手法包括角色扮演、虚构情境、把敏感请求拆成多个看似无害的片段,或使用特殊编码。这类攻击之所以奏效,是因为模型很难把意图层面的判断与字面层面的指令服从完全分开。

与对抗样本不同,越狱不依赖梯度计算,普通人用文字就能尝试,因此传播更快、变体更多。研究者通常以红队测试的方式主动模拟攻击,把发现的失效模式纳入后续训练与规则更新,这也是当前主流模型持续迭代安全能力的常见流程。

防御在做什么

对抗防御中应用较广的是对抗训练,即在训练数据里加入对抗样本,让模型学会对这些扰动保持稳定。它效果明确,但会提高训练成本,也可能轻微降低在正常样本上的表现。此外还有输入预处理、随机化与异常检测等方法,用于在使用环节过滤可疑输入。

在模型服务层面,常见做法是部署多层防护:输入侧检测明显的攻击模式,模型侧保留安全策略,输出侧再对结果做一次审查。需要说明的是,安全研究普遍认为防御是一个持续的攻防过程,新攻击会不断出现,因此监控、更新与快速响应机制和模型本身同样重要。

常见问题

普通用户需要担心对抗样本吗?

日常使用中不必过度担心,这类攻击多出现在研究或针对性场景中。更值得关注的是与个人直接相关的风险,比如账号防护、不明链接与钓鱼信息。使用 AI 服务时,注意不把敏感信息交给不可信的第三方工具,是更实际的安全习惯。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。