
OpenAI 通过强化学习驱动的自动化红队测试,持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线。本文深入解析了提示注入的风险、自动化攻击发现方法以及最新安全更新,展示了 OpenAI 在 AI 代理安全领域的持续投入。
2025年12月22日,OpenAI 发布了一项关于 ChatGPT Atlas 安全性的重要更新。通过强化学习驱动的自动化红队测试,OpenAI 能够主动发现并修复针对浏览器代理的现实世界漏洞,防止其被恶意利用。这一更新源于内部发现的新型提示注入攻击,并已通过对抗性训练模型和强化安全机制得到缓解。
ChatGPT Atlas 中的代理模式是 OpenAI 迄今为止发布的最通用的代理功能之一。在该模式下,浏览器代理能够像用户一样查看网页、执行操作、点击和输入键盘指令。这使得 ChatGPT 能够直接在用户的日常工作中发挥作用,利用相同的空间、上下文和数据。
然而,随着浏览器代理帮助用户完成更多任务,它也成为对抗性攻击的高价值目标。这使得 AI 安全变得尤为重要。在 ChatGPT Atlas 发布前,OpenAI 已持续构建并强化防御机制,以应对针对“浏览器中的代理”这一新范式的威胁。提示注入(Prompt Injection)是 OpenAI 积极防御的重大风险之一,旨在确保 ChatGPT Atlas 能够安全地代表用户操作。
提示注入攻击通过将恶意指令嵌入到 AI 代理处理的内容中,从而覆盖或重定向代理的行为,使其遵循攻击者的意图而非用户的指令。对于 ChatGPT Atlas 中的浏览器代理,提示注入增加了传统网络安全风险(如用户错误或软件漏洞)之外的新威胁向量。攻击者不再针对人类进行钓鱼或利用浏览器系统漏洞,而是直接攻击运行在浏览器中的代理。
举例来说,攻击者可能发送一封恶意邮件,试图诱使代理忽略用户的请求,反而将敏感的税务文件转发到攻击者控制的邮箱。如果用户要求代理查看未读邮件并总结要点,代理在工作流程中可能会读取该恶意邮件。若它遵循了注入的指令,就可能偏离任务,错误地分享敏感信息。
这只是一个具体场景。浏览器代理的通用性也扩大了风险范围:代理可能会在电子邮件及附件、日历邀请、共享文档、论坛、社交媒体帖子和任意网页中遇到不可信的指令。由于代理可以执行用户在浏览器中能执行的许多操作,成功攻击的潜在影响同样广泛:转发敏感邮件、转账、编辑或删除云端文件等。
OpenAI 在之前的博文中提到,已通过多层安全机制在防御提示注入方面取得进展。然而,提示注入仍然是代理安全领域的开放挑战,并且 OpenAI 预计将持续多年致力于此。
为了加强防御,OpenAI 持续在生产环境中搜索针对代理系统的新型提示注入攻击。发现这些攻击是构建强大防御措施的必要前提:它有助于理解现实世界风险、暴露防御漏洞并推动具体补丁。
为了实现规模化,OpenAI 构建了一个基于 LLM 的自动化攻击者,并训练其寻找能够成功攻击浏览器代理的提示注入攻击。该攻击者通过端到端强化学习进行训练,从自身的成功和失败中学习以提升红队测试技能。此外,OpenAI 允许攻击者“在发布前尝试”,即在推理过程中,攻击者可以提出候选注入指令,并将其发送到外部模拟器。模拟器会运行一个反事实推演,模拟目标受害者代理(防御者)在遇到该注入时的行为,并返回受害者代理的完整推理和行动轨迹。攻击者利用该轨迹作为反馈,迭代攻击并重新运行模拟,在提交最终攻击前多次重复此循环。这为攻击者提供了比单一通过/失败信号更丰富的上下文反馈,并显著扩展了搜索范围。
通过上述自动化红队测试,OpenAI 发现了一类新的提示注入攻击,并迅速推动了安全更新。此次更新包括:
OpenAI 将提示注入视为长期的 AI 安全挑战,并需要像应对不断演变的人类网络诈骗一样持续强化防御。最新的快速响应循环已显示出早期成效:OpenAI 在外部攻击者发现之前,已在内部发现了新型攻击策略。长远目标是充分利用(1)对模型的完全访问权限(白盒访问)、(2)对防御机制的深入理解以及(3)计算规模优势,从而领先于外部攻击者——更早发现漏洞、更快发布补丁、持续收紧循环。结合针对提示注入的新技术前沿研究以及在其他安全控制上的投资,这种复合循环将使攻击变得越来越困难和昂贵,从而大幅降低现实世界中的提示注入风险。最终,OpenAI 的目标是让用户能够像信任一位能力强且安全意识高的同事或朋友一样,信任 ChatGPT 代理使用用户的浏览器。
OpenAI 通过自动化红队测试和强化学习,持续强化 ChatGPT Atlas 对抗提示注入攻击的能力。此次安全更新是快速响应循环的体现,展示了 OpenAI 在 AI 安全领域的持续投入和创新。未来,OpenAI 将继续探索新的防御技术,以应对不断演变的威胁,确保用户能够安全地使用 AI 代理。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。