
OpenAI发布gpt-oss-safeguard-120b和gpt-oss-safeguard-20b两款开源安全审核模型,基于Apache 2.0许可,支持政策驱动的推理内容分类,具备完整思维链输出和结构化输出能力。
2025年10月29日,OpenAI 正式发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两款开源权重推理模型。这两款模型基于 gpt-oss 系列进行后训练,能够根据提供的政策进行推理判断,从而对内容进行合规标注。模型采用 Apache 2.0 许可证 发布,并遵循 OpenAI 的 gpt-oss 使用政策,标志着 OpenAI News 在开源 AI 安全领域迈出重要一步。
在开源社区的反馈支持下,这两款纯文本模型具备以下关键能力:
OpenAI 在技术报告中详细描述了 gpt-oss-safeguard 的能力,并以底层 gpt-oss 模型为基准进行了安全性评估。报告明确指出:
推荐用途:这些模型最适合用于根据给定政策对内容进行分类,而非直接作为终端用户交互的核心功能。对于用户交互场景,原始 gpt-oss 模型更为合适。
为了全面评估模型在非预期使用场景下的安全性,OpenAI 进行了以下测试:
gpt-oss-safeguard 模型是在 gpt-oss 基础上进行微调,未额外引入任何生物或网络安全相关训练数据。因此,OpenAI 认定此前对 gpt-oss 发布时估算的最坏情况风险评估同样适用于这些新模型。这意味着开发者在使用时需持续关注潜在风险。
| 模型 | 参数规模 | 主要用途 | 许可协议 |
|---|---|---|---|
| gpt-oss-safeguard-120b | 1200亿 | 政策驱动的内容审核 | Apache 2.0 |
| gpt-oss-safeguard-20b | 200亿 | 轻量级内容审核 | Apache 2.0 |
OpenAI 强调,这些模型的开发过程中充分吸纳了开源社区的反馈。通过 Apache 2.0 许可证,开发者可以:
这一举措预计将推动 AI 安全领域的开源协作,降低企业构建内容审核系统的门槛。
多位 AI 安全领域专家对此次发布表示关注:
“gpt-oss-safeguard 系列模型填补了开源 AI 在政策驱动内容审核方面的空白。其完整的思维链输出能力尤其值得关注,这使得审核过程更加透明和可审计。” —— 某 AI 安全研究机构首席科学家
随着 AI 内容审核需求的持续增长,OpenAI 此次开源举措可能产生以下影响:
gpt-oss-safeguard 的发布是 OpenAI News 在开源 AI 安全领域的重要里程碑。通过提供可定制、可审计的内容审核模型,OpenAI 不仅增强了自身产品生态,也为整个 AI 社区贡献了宝贵的开源资源。开发者应充分利用这些模型的优势,同时注意其使用边界,确保在合规和安全的前提下发挥最大价值。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

谷歌地球AI图像生成功能因被滥用而紧急撤回,暴露了AI技术应用中的伦理和审核漏洞。本文分析事件始末,探讨AI内容生成的风险管理,并为SEO从业者提供实战启示。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。