
OpenAI 于2026年3月25日推出全新安全漏洞悬赏计划,聚焦 AI 滥用与安全风险,覆盖智能体风险、专有信息泄露、账户完整性三大领域,作为传统安全漏洞悬赏的补充。
AI 滥用与安全风险 2026年3月25日,OpenAI 正式宣布启动一项全新的公开安全漏洞悬赏计划(Safety Bug Bounty),旨在识别并应对其产品中潜在的 AI 滥用与安全风险。随着人工智能技术的飞速发展,其被滥用的可能性也在同步增加。OpenAI 的目标是确保其系统在面对可能导致实际伤害的滥用行为时,依然保持安全与可靠。
这一新计划将作为 OpenAI 现有安全漏洞悬赏计划(Security Bug Bounty)的有力补充。与后者主要关注传统安全漏洞不同,新的安全漏洞悬赏计划专门接受那些虽不符合传统安全漏洞标准,但会带来实质性滥用与安全风险的问题。OpenAI 希望通过此举,继续与安全研究社区紧密合作,共同识别并解决那些超出常规安全范畴但依然构成真实威胁的隐患。 所有提交的问题将由 OpenAI 的安全与安全漏洞悬赏团队进行分类评估,并根据问题范围和归属,在两个计划之间进行合理转派。
新的安全漏洞悬赏计划主要聚焦于以下几类与 AI 特定安全场景相关的问题:
Risks),包括 MCP(Model Context Protocol) - 第三方提示注入与数据泄露:攻击者通过文本内容成功劫持用户的智能体(包括浏览器、ChatGPT Agent 等类似产品),诱使其执行有害操作或泄露用户敏感信息。该行为需至少达到 50% 的复现率。
专有信息 - 模型生成内容泄露推理过程相关的专有信息。
账户与平台完整性信号的漏洞:如绕过反自动化控制、操纵账户信任信号、规避账户限制/暂停/封禁等。
权限越界问题:允许用户访问超出授权权限的功能、数据或操作的问题,此类问题应提交至 Security Bug Bounty 计划。
需要特别说明的是,通用越狱(jailbreak)行为不在本计划范围内。但 OpenAI 会定期针对特定伤害类型开展私密漏洞悬赏活动,例如 ChatGPT Agent 和 GPT-5 中的生物风险内容问题。研究者可以在这些活动启动时申请参与。 对于上述类别之外的问题,如果研究者能够识别出直接导致用户伤害的缺陷,并提供可操作、可离散修复的步骤,OpenAI 将根据具体情况考虑给予奖励。 反之,那些无法证明有实际安全或滥用影响的通用内容策略绕过行为(例如,仅导致模型使用粗鲁语言或返回搜索引擎易查信息的越狱)不在本计划范围内。
有兴趣的研究者可以通过 OpenAI 的安全漏洞悬赏计划页面申请参与。OpenAI 期待与全球的研究者、道德黑客以及安全社区携手合作,共同构建一个安全可靠的 AI 生态系统。 ---
OpenAI 与 Hugging Face 共同应对安全事件(2026年7月21日)
长周期模型时代的安全与对齐(2026年7月20日)
为什么青少年值得获得安全的 AI 访问(2026年7月16日)
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI 在 ChatGPT Work 中推出 Data agent,让员工用自然语言连接企业数据、生成看板并直接行动。本文解析其数据源、语义层与权限设计,并对比国内同类进展。

Fyxer 将 OpenAI 模型与 50 万小时行政助理工作流数据结合,用 30-50 个专用模型拆解邮件处理,并通过用户编辑反馈持续优化,实现 90 天留存率 90%、53% 草稿被原样采纳。

Cognition 将 GPT‑6 Astra 用于 Devin 的测试与验证,让 AI 在写完代码后自行运行、录屏并生成报告,目标是把工程师从逐行审查中解放出来,转向更高价值的判断。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。