Технический блог BingdadaТехнический блог Bingdada
ГлавнаяБлогSEOGEOAEOAIИнструментыО нас
ВойтиРегистрация
Logo

Технический блог Bingdada

Технический блог, посвящённый SEO, GEO и тенденциям развития искусственного интеллекта.

Быстрые ссылки

  • Главная
  • Статьи блога
  • О нас

Контакты

  • 398848662@qq.com

Подпишитесь на нашу рассылку, чтобы получать свежие материалы по SEO и GEO.

© 2024 Bingdada 技术博客. All rights reserved.

Статья на упрощённом китайском. Перевести на Русский в один клик.
ГлавнаяБлогAI人工智能OpenAI 持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线
OpenAI 持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线
AI人工智能

OpenAI 持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线

bingdadabingdada
августа 2, 2026205 прочтений6 мин чтения
post.quickAnswer

OpenAI 通过强化学习驱动的自动化红队测试,持续强化 ChatGPT Atlas 对抗提示注入攻击的安全防线。本文深入解析了提示注入的风险、自动化攻击发现方法以及最新安全更新,展示了 OpenAI 在 AI 代理安全领域的持续投入。

post.keyTakeaways
  • ChatGPT Atlas 的代理模式与安全挑战
  • 提示注入:代理安全的开放挑战
  • 自动化提示注入攻击发现:端到端强化学习
  • 快速响应循环与安全更新
Содержание

Содержание

  • 概述
  • ChatGPT Atlas 的代理模式与安全挑战
  • 提示注入:代理安全的开放挑战
  • 自动化提示注入攻击发现:端到端强化学习
  • 快速响应循环与安全更新
  • 结论
  • 相关阅读
  • 关于 Bingdada

概述

2025年12月22日,OpenAI 发布了一项关于 ChatGPT Atlas 安全性的重要更新。通过强化学习驱动的自动化红队测试,OpenAI 能够主动发现并修复针对浏览器代理的现实世界漏洞,防止其被恶意利用。这一更新源于内部发现的新型提示注入攻击,并已通过对抗性训练模型和强化安全机制得到缓解。

ChatGPT Atlas 的代理模式与安全挑战

ChatGPT Atlas 中的代理模式是 OpenAI 迄今为止发布的最通用的代理功能之一。在该模式下,浏览器代理能够像用户一样查看网页、执行操作、点击和输入键盘指令。这使得 ChatGPT 能够直接在用户的日常工作中发挥作用,利用相同的空间、上下文和数据。 然而,随着浏览器代理帮助用户完成更多任务,它也成为对抗性攻击的高价值目标。这使得 AI 安全变得尤为重要。在 ChatGPT Atlas 发布前,OpenAI 已持续构建并强化防御机制,以应对针对“浏览器中的代理”这一新范式的威胁。提示注入(Prompt Injection)是 OpenAI 积极防御的重大风险之一,旨在确保 ChatGPT Atlas 能够安全地代表用户操作。

提示注入:代理安全的开放挑战

提示注入攻击通过将恶意指令嵌入到 AI 代理处理的内容中,从而覆盖或重定向代理的行为,使其遵循攻击者的意图而非用户的指令。对于 ChatGPT Atlas 中的浏览器代理,提示注入增加了传统网络安全风险(如用户错误或软件漏洞)之外的新威胁向量。攻击者不再针对人类进行钓鱼或利用浏览器系统漏洞,而是直接攻击运行在浏览器中的代理。 举例来说,攻击者可能发送一封恶意邮件,试图诱使代理忽略用户的请求,反而将敏感的税务文件转发到攻击者控制的邮箱。如果用户要求代理查看未读邮件并总结要点,代理在工作流程中可能会读取该恶意邮件。若它遵循了注入的指令,就可能偏离任务,错误地分享敏感信息。 这只是一个具体场景。浏览器代理的通用性也扩大了风险范围:代理可能会在电子邮件及附件、日历邀请、共享文档、论坛、社交媒体帖子和任意网页中遇到不可信的指令。由于代理可以执行用户在浏览器中能执行的许多操作,成功攻击的潜在影响同样广泛:转发敏感邮件、转账、编辑或删除云端文件等。 OpenAI 在之前的博文中提到,已通过多层安全机制在防御提示注入方面取得进展。然而,提示注入仍然是代理安全领域的开放挑战,并且 OpenAI 预计将持续多年致力于此。

自动化提示注入攻击发现:端到端强化学习

为了加强防御,OpenAI 持续在生产环境中搜索针对代理系统的新型提示注入攻击。发现这些攻击是构建强大防御措施的必要前提:它有助于理解现实世界风险、暴露防御漏洞并推动具体补丁。 为了实现规模化,OpenAI 构建了一个基于 LLM 的自动化攻击者,并训练其寻找能够成功攻击浏览器代理的提示注入攻击。该攻击者通过端到端强化学习进行训练,从自身的成功和失败中学习以提升红队测试技能。此外,OpenAI 允许攻击者“在发布前尝试”,即在推理过程中,攻击者可以提出候选注入指令,并将其发送到外部模拟器。模拟器会运行一个反事实推演,模拟目标受害者代理(防御者)在遇到该注入时的行为,并返回受害者代理的完整推理和行动轨迹。攻击者利用该轨迹作为反馈,迭代攻击并重新运行模拟,在提交最终攻击前多次重复此循环。这为攻击者提供了比单一通过/失败信号更丰富的上下文反馈,并显著扩展了搜索范围。

快速响应循环与安全更新

通过上述自动化红队测试,OpenAI 发现了一类新的提示注入攻击,并迅速推动了安全更新。此次更新包括:

  • 对抗性训练模型:使用新发现的攻击数据对模型进行再训练,使其更能抵抗提示注入。
  • 强化周边安全机制:在代理工作流程中增加额外的安全检查,防止恶意指令被执行。 OpenAI 将提示注入视为长期的 AI 安全挑战,并需要像应对不断演变的人类网络诈骗一样持续强化防御。最新的快速响应循环已显示出早期成效:OpenAI 在外部攻击者发现之前,已在内部发现了新型攻击策略。长远目标是充分利用(1)对模型的完全访问权限(白盒访问)、(2)对防御机制的深入理解以及(3)计算规模优势,从而领先于外部攻击者——更早发现漏洞、更快发布补丁、持续收紧循环。结合针对提示注入的新技术前沿研究以及在其他安全控制上的投资,这种复合循环将使攻击变得越来越困难和昂贵,从而大幅降低现实世界中的提示注入风险。最终,OpenAI 的目标是让用户能够像信任一位能力强且安全意识高的同事或朋友一样,信任 ChatGPT 代理使用用户的浏览器。

结论

OpenAI 通过自动化红队测试和强化学习,持续强化 ChatGPT Atlas 对抗提示注入攻击的能力。此次安全更新是快速响应循环的体现,展示了 OpenAI 在 AI 安全领域的持续投入和创新。未来,OpenAI 将继续探索新的防御技术,以应对不断演变的威胁,确保用户能够安全地使用 AI 代理。

相关阅读

  • Notion 如何借助 Codex 将开发时间从两周缩短至三小时

  • OpenAI Grove 第二期:助力早期创业者的AI人才计划

  • OpenAI 回应 Axios 开发者工具安全事件:要求 macOS 用户更新应用

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

Содержание

  • 概述
  • ChatGPT Atlas 的代理模式与安全挑战
  • 提示注入:代理安全的开放挑战
  • 自动化提示注入攻击发现:端到端强化学习
  • 快速响应循环与安全更新
  • 结论
  • 相关阅读
  • 关于 Bingdada
Премиум рекламное место · Ограниченное время
Рекламные места в аренду

Поместите бренд в ленту читателя

Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.

Сотрудничество

Теги

#OpenAI News#提示注入#强化学习#AI 安全#ChatGPT Atlas
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Похожие статьи

GPT-6 Astra 法律专用版问世:OpenAI 如何重新定义法律 AI 基础设施
AI人工智能

GPT-6 Astra 法律专用版问世:OpenAI 如何重新定义法律 AI 基础设施

OpenAI 发布 Astra for Law,将 GPT-6 Astra 与法律搜索索引、专业指令和治理工具整合,面向律所提供 AI 基础底座。本文分析其技术架构、性能数据、隐私治理及对国内法律 AI 的启示。

сент. 197 мин чтения
当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周
AI人工智能

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周

国际律所 Cooley 基于 ChatGPT Work 打造 GO Public,用代理编排层重构 IPO 准备流程:AI 负责信息梳理,律师专注判断与决策。本文解析其运作逻辑,并对比国内法律 AI 的落地路径。

сент. 185 мин чтения
银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城
AI人工智能

银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城

OpenAI 与 AARP 旗下 OATS 合作,在美国10座城市为老年人开设免费 ChatGPT 线下工作坊,课程兼顾日常应用与防诈骗教育,为AI普惠提供了可复制的社区样本。

сент. 176 мин чтения

Подпишитесь на рассылку

Получайте свежие материалы по SEO и GEO.

Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.

Комментарии ({count}) (0)

Войдите, чтобы присоединиться к обсуждению

ВойтиРегистрация
Комментариев пока нет, будьте первым