
加强安全生态系统:OpenAI 外部测试新策略
OpenAI 通过独立评估、方法论审查和领域专家探测三种形式的外部测试,强化前沿 AI 的安全生态系统。第三方评估验证安全声明、防止盲点、提高透明度,并帮助做出负责任的部署决策。
浏览所有关于 SEO、GEO 和搜索优化的技术文章

OpenAI 通过独立评估、方法论审查和领域专家探测三种形式的外部测试,强化前沿 AI 的安全生态系统。第三方评估验证安全声明、防止盲点、提高透明度,并帮助做出负责任的部署决策。

OpenAI 发布 GPT-5.2-Codex 系统卡附录,详解其先进代理编码模型的安全措施与能力评估。该模型在上下文压缩、项目级任务和网络安全方面显著提升,但网络安全尚未达到高能力阈值,生物学领域则被归类为高能力并部署相应防护。

OpenAI更新模型规范,引入U18原则以保护13-17岁青少年安全。基于发育科学,该原则强调预防、透明和早期干预,并得到美国心理学会等专家支持。

OpenAI宣布向英国AI安全研究所创立的“对齐项目”提供750万美元资助,旨在支持全球独立AI对齐研究。该笔资金将用于探索计算复杂性理论、认知科学等多元领域,强化前沿实验室之外的独立研究生态系统,确保AGI安全发展。

OpenAI 2026年2月安全报告揭示了威胁行为者如何利用AI与传统工具结合进行恶意活动,包括跨模型操作和自动化攻击。报告提供了案例研究和防御策略,强调行业合作与主动预防的重要性。

OpenAI 最新研究发现,即使被告知被监控,推理模型也难以控制其思维链。这种低可控性对 AI 安全有利,表明思维链监控仍是可靠的安全屏障。文章介绍了 CoT-Control 评估套件,并分析了其对 AI 安全的启示。

OpenAI发布GPT-5.4 Thinking系统卡,这是首个在网络安全领域实施高能力缓解措施的通用推理模型。本文深入解读其核心特性、技术架构与行业影响。

OpenAI 发布 IH-Challenge 训练数据集,通过强化学习优化大模型的指令层级优先级,显著提升对提示注入攻击的鲁棒性和安全可操控性,同时避免过度拒绝。

OpenAI日本发布《日本青少年安全蓝图》,通过年龄感知保护、强化安全政策、家长控制工具和以福祉为中心的设计,为青少年安全使用生成式AI提供全面保障。

OpenAI 发布 GPT-5.4-Cyber 并大幅扩展可信访问计划,通过民主化访问、迭代部署和生态系统投资,为下一时代网络防御提供 AI 驱动的新工具,帮助防御者应对日益复杂的网络威胁。

OpenAI 推出“可信网络访问”计划,联合全球领先企业、安全供应商及开源团队,构建广泛参与的网络防御生态系统。该计划以信任与验证为基础,通过API投资和前沿模型共享,加速防御能力普及,守护关键数字基础设施。

OpenAI发布社区安全承诺声明,详细介绍了如何通过模型训练、自动化检测系统和人工审核来防范暴力与危害内容,包括识别细微风险信号、提供危机资源支持、执行零容忍政策等关键措施。