Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能OpenAI社区安全承诺:如何防范暴力与危害内容
OpenAI社区安全承诺:如何防范暴力与危害内容
AI人工智能

OpenAI社区安全承诺:如何防范暴力与危害内容

bingdadabingdada
八月 2, 20266 次阅读约 7 分钟阅读
快速回答

OpenAI发布社区安全承诺声明,详细介绍了如何通过模型训练、自动化检测系统和人工审核来防范暴力与危害内容,包括识别细微风险信号、提供危机资源支持、执行零容忍政策等关键措施。

核心要点
  • 我们的社区安全承诺
  • 如何在 ChatGPT 中减轻危害风险
  • 对处于困境或自残风险用户的支持
  • 如何监控和执行规则
  • 提供现实世界支持并适时移交执法部门
目录

目录

  • 我们的社区安全承诺
  • 如何在 ChatGPT 中减轻危害风险
  • 对处于困境或自残风险用户的支持
  • 如何监控和执行规则
  • 提供现实世界支持并适时移交执法部门
  • 持续改进与未来展望

我们的社区安全承诺

2026年4月28日,OpenAI 发布了一份关于社区安全承诺的重要声明。在当今世界,大规模枪击、针对公职人员的威胁、炸弹袭击以及对社区和个人的攻击,已经成为不可接受且严峻的现实。这些事件提醒我们,暴力的威胁是多么真实——暴力意图从言语转化为行动的速度可以有多快。

人们可能会将这些时刻和感受带入与 ChatGPT 的对话中。他们可能会询问新闻相关的问题,试图理解发生了什么,表达恐惧或愤怒,或者以虚构、历史、政治、个人或潜在危险的方式谈论暴力。我们的工作是训练 ChatGPT 识别这些区别——并在对话开始转向威胁、对他人潜在伤害或现实世界策划时划清界限。

我们在此分享为减少服务被用于促进暴力或其他危害所采取的措施:我们的模型如何被训练以安全回应,我们的系统如何检测潜在风险,以及当有人违反政策时我们采取什么行动。在心理学家、精神病学家、公民自由和执法专家以及其他帮助我们应对安全、隐私和民主化访问等艰难决策的人士的指导下,我们正在不断改进保护个人和社区的步骤。

如何在 ChatGPT 中减轻危害风险

我们的模型规范(Model Spec)阐述了我们希望模型如何行为的长期原则:在通过合理默认设置最小化伤害风险的同时,最大化有用性和用户自由。我们努力训练模型拒绝那些可能实际促成暴力的指令、策略或规划请求。同时,人们可能会出于事实、历史、教育或预防目的提出关于暴力的中性问题,我们旨在允许这些讨论,同时保持明确的安全边界——例如,省略可能促进伤害的详细操作指令。

良性使用和有害使用之间的界限可能很微妙,因此我们不断改进方法,并与专家合作,以区分安全的、有边界的回应和可用于实施暴力或其他现实世界危害的可操作步骤。

作为这项持续工作的一部分,我们不断扩展安全防护措施,帮助 ChatGPT 更好地识别不同语境下风险的细微迹象。一些安全风险只有随着时间的推移才会变得清晰:单条消息本身可能看起来无害,但长对话中的更广泛模式——或跨对话的模式——可能暗示更令人担忧的事情。基于多年在模型训练、评估和红队测试方面的工作,以及持续的专家意见,我们加强了 ChatGPT 在长、高风险对话中识别细微警告信号并谨慎回应的能力。我们将在未来几周分享更多关于这项工作的信息。

对处于困境或自残风险用户的支持

我们的安全工作还扩展到用户可能处于困境或有自残风险的情况。在这些时刻,我们的目标是避免促成有害行为,同时帮助缓和局势,引导人们获得现实世界的支持。ChatGPT 会提供本地化的危机资源,鼓励人们联系心理健康专业人士或值得信赖的亲人,在最严重的情况下会引导人们寻求紧急帮助。

如何监控和执行规则

我们假设用户是善意的,但当我们检测到有人试图使用我们的工具来策划或实施暴力时,我们会采取行动,包括撤销对 OpenAI 服务的访问权限。我们的使用政策(Usage Policies)明确设定了可接受使用的期望,并且我们可能禁止将服务用于威胁、恐吓、骚扰、恐怖主义或暴力、武器开发、非法活动、破坏财产或系统,以及试图规避我们的安全防护。

我们认真对待这些政策,并努力执行。我们使用自动化检测系统大规模识别潜在的可疑活动。这些系统使用一系列工具分析用户内容和行为,旨在识别可能指示政策违规或有害活动的信号,包括分类器、推理模型、哈希匹配技术、黑名单和其他监控系统。

当一个账户或对话被标记时,会由受过培训的人员在上下文中进行评估。这些人工审核员接受过我们政策和协议的培训,并在既定的隐私和安全保护措施内操作,意味着他们对用户信息的访问是有限的,在安全系统内进行,并受保密和数据保护要求的约束。他们的角色是在上下文中评估被标记的活动,包括交互内容、周围对话以及任何相关的时间行为模式。这种上下文审查很重要,因为自动化系统可能识别出潜在关注的信号,而无法完全捕捉意图或细微差别。

目标是确定被标记的活动是否违反我们的政策,和/或表明用户可能实施暴力行为,是否需要升级进行更详细的人工审查,或者可以被视为低风险或非违规而忽略或降低优先级。当我们确定发生了可被封禁的违规行为时,我们会立即撤销对 OpenAI 服务的访问权限。这可能包括禁用账户、禁止同一用户的其他账户,并采取措施检测和阻止新账户的开立。我们对使用我们的工具协助实施暴力采取零容忍政策。人们可以对执行决定提出上诉,我们会审查这些上诉以确认结果。

提供现实世界支持并适时移交执法部门

大多数执法行动,包括因暴力而封禁,都直接在 OpenAI 和用户之间进行,明确告知他们越界了。但在一些敏感案件中,我们可能会联系最有能力提供帮助的其他方。当我们评估一个案例呈现可能即将发生伤害的指标时,我们可能会联系执法部门。

持续改进与未来展望

OpenAI 致力于在不断变化的环境中保护社区安全。我们将继续与专家合作,改进模型训练、检测系统和响应机制,以确保在最大化用户自由的同时,最小化暴力和其他危害的风险。我们相信,通过透明度、合作和持续创新,我们可以建立一个更安全的 AI 生态系统。

随着 AI 技术的不断发展,安全挑战也在演变。我们将定期更新我们的方法,分享进展,并听取社区的反馈。最终,我们的目标是为所有人创造一个安全、有益且负责任的 AI 体验。

目录

  • 我们的社区安全承诺
  • 如何在 ChatGPT 中减轻危害风险
  • 对处于困境或自残风险用户的支持
  • 如何监控和执行规则
  • 提供现实世界支持并适时移交执法部门
  • 持续改进与未来展望
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#AI安全#ChatGPT安全#社区安全#暴力防范
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

OpenAI如何用AI提升销售效率与客户成功
AI人工智能

OpenAI如何用AI提升销售效率与客户成功

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

8月 4约 5 分钟阅读
OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代
AI人工智能

OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

8月 4约 6 分钟阅读
Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻
AI人工智能

Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。

8月 4约 5 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧