
OpenAI发布社区安全承诺声明,详细介绍了如何通过模型训练、自动化检测系统和人工审核来防范暴力与危害内容,包括识别细微风险信号、提供危机资源支持、执行零容忍政策等关键措施。
2026年4月28日,OpenAI 发布了一份关于社区安全承诺的重要声明。在当今世界,大规模枪击、针对公职人员的威胁、炸弹袭击以及对社区和个人的攻击,已经成为不可接受且严峻的现实。这些事件提醒我们,暴力的威胁是多么真实——暴力意图从言语转化为行动的速度可以有多快。
人们可能会将这些时刻和感受带入与 ChatGPT 的对话中。他们可能会询问新闻相关的问题,试图理解发生了什么,表达恐惧或愤怒,或者以虚构、历史、政治、个人或潜在危险的方式谈论暴力。我们的工作是训练 ChatGPT 识别这些区别——并在对话开始转向威胁、对他人潜在伤害或现实世界策划时划清界限。
我们在此分享为减少服务被用于促进暴力或其他危害所采取的措施:我们的模型如何被训练以安全回应,我们的系统如何检测潜在风险,以及当有人违反政策时我们采取什么行动。在心理学家、精神病学家、公民自由和执法专家以及其他帮助我们应对安全、隐私和民主化访问等艰难决策的人士的指导下,我们正在不断改进保护个人和社区的步骤。
我们的模型规范(Model Spec)阐述了我们希望模型如何行为的长期原则:在通过合理默认设置最小化伤害风险的同时,最大化有用性和用户自由。我们努力训练模型拒绝那些可能实际促成暴力的指令、策略或规划请求。同时,人们可能会出于事实、历史、教育或预防目的提出关于暴力的中性问题,我们旨在允许这些讨论,同时保持明确的安全边界——例如,省略可能促进伤害的详细操作指令。
良性使用和有害使用之间的界限可能很微妙,因此我们不断改进方法,并与专家合作,以区分安全的、有边界的回应和可用于实施暴力或其他现实世界危害的可操作步骤。
作为这项持续工作的一部分,我们不断扩展安全防护措施,帮助 ChatGPT 更好地识别不同语境下风险的细微迹象。一些安全风险只有随着时间的推移才会变得清晰:单条消息本身可能看起来无害,但长对话中的更广泛模式——或跨对话的模式——可能暗示更令人担忧的事情。基于多年在模型训练、评估和红队测试方面的工作,以及持续的专家意见,我们加强了 ChatGPT 在长、高风险对话中识别细微警告信号并谨慎回应的能力。我们将在未来几周分享更多关于这项工作的信息。
我们的安全工作还扩展到用户可能处于困境或有自残风险的情况。在这些时刻,我们的目标是避免促成有害行为,同时帮助缓和局势,引导人们获得现实世界的支持。ChatGPT 会提供本地化的危机资源,鼓励人们联系心理健康专业人士或值得信赖的亲人,在最严重的情况下会引导人们寻求紧急帮助。
我们假设用户是善意的,但当我们检测到有人试图使用我们的工具来策划或实施暴力时,我们会采取行动,包括撤销对 OpenAI 服务的访问权限。我们的使用政策(Usage Policies)明确设定了可接受使用的期望,并且我们可能禁止将服务用于威胁、恐吓、骚扰、恐怖主义或暴力、武器开发、非法活动、破坏财产或系统,以及试图规避我们的安全防护。
我们认真对待这些政策,并努力执行。我们使用自动化检测系统大规模识别潜在的可疑活动。这些系统使用一系列工具分析用户内容和行为,旨在识别可能指示政策违规或有害活动的信号,包括分类器、推理模型、哈希匹配技术、黑名单和其他监控系统。
当一个账户或对话被标记时,会由受过培训的人员在上下文中进行评估。这些人工审核员接受过我们政策和协议的培训,并在既定的隐私和安全保护措施内操作,意味着他们对用户信息的访问是有限的,在安全系统内进行,并受保密和数据保护要求的约束。他们的角色是在上下文中评估被标记的活动,包括交互内容、周围对话以及任何相关的时间行为模式。这种上下文审查很重要,因为自动化系统可能识别出潜在关注的信号,而无法完全捕捉意图或细微差别。
目标是确定被标记的活动是否违反我们的政策,和/或表明用户可能实施暴力行为,是否需要升级进行更详细的人工审查,或者可以被视为低风险或非违规而忽略或降低优先级。当我们确定发生了可被封禁的违规行为时,我们会立即撤销对 OpenAI 服务的访问权限。这可能包括禁用账户、禁止同一用户的其他账户,并采取措施检测和阻止新账户的开立。我们对使用我们的工具协助实施暴力采取零容忍政策。人们可以对执行决定提出上诉,我们会审查这些上诉以确认结果。
大多数执法行动,包括因暴力而封禁,都直接在 OpenAI 和用户之间进行,明确告知他们越界了。但在一些敏感案件中,我们可能会联系最有能力提供帮助的其他方。当我们评估一个案例呈现可能即将发生伤害的指标时,我们可能会联系执法部门。
OpenAI 致力于在不断变化的环境中保护社区安全。我们将继续与专家合作,改进模型训练、检测系统和响应机制,以确保在最大化用户自由的同时,最小化暴力和其他危害的风险。我们相信,通过透明度、合作和持续创新,我们可以建立一个更安全的 AI 生态系统。
随着 AI 技术的不断发展,安全挑战也在演变。我们将定期更新我们的方法,分享进展,并听取社区的反馈。最终,我们的目标是为所有人创造一个安全、有益且负责任的 AI 体验。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。