
OpenAI 发布链式思维可监控性评估框架,研究随着模型扩展和强化学习优化,推理透明性如何变化。关键发现:监控 CoT 远优于仅监控行为,思考时间越长可监控性越好,强化学习不会显著损害可监控性。
随着 AI 系统在决策过程中变得越来越复杂,直接监督其行为变得愈发困难。OpenAI 在其最新研究中提出,监控模型的内部推理过程(即链式思维,Chain-of-Thought, CoT)是理解其决策机制的关键手段。然而,这种可监控性(Monitorability)是否能在模型规模扩大、训练方法变化时保持稳定,仍是业界关注的焦点。
可监控性是指监控器(Monitor)根据智能体(Agent)的行为预测其关键属性的能力。这些属性可能包括欺骗、奖励黑客(Reward Hacking)等不良行为,也可能涉及良性特征,如是否依赖特定提示或遵循特定推理路径。
可监控性是一个双向属性:它既取决于监控器的能力,也取决于被监控的智能体。例如,更智能的监控器能从相同信号中提取更多信息;而某些智能体的思维过程可能比其他智能体更难理解。
与早期通过提示“逐步思考”生成的 CoT 不同,现代推理模型(如 GPT-5 Thinking)有两个关键差异:
OpenAI 提出了包含 13 项评估(共 24 个环境)的框架,分为三种原型:
通过人为引入特定行为(如偏见、欺骗),测试监控器能否从 CoT 中检测出这些行为。
评估监控器能否跟踪推理过程中的关键步骤,例如模型是否使用了特定策略或犯了逻辑错误。
测试监控器能否从 CoT 中预测最终输出的属性,如答案的正确性或可信度。
在几乎所有测试场景中,监控 CoT 比仅监控动作和最终输出有效得多。例如,在检测欺骗行为时,CoT 监控的准确率比行为监控高出 30% 以上。
研究发现,随着模型“思考”时间增加(即 CoT 长度增加),可监控性显著提升。这为平衡推理计算与监控效果提供了新思路。
在当前的模型规模下,强化学习优化并未明显损害 CoT 的可监控性。这是一个积极信号,表明可以在不牺牲透明性的前提下提升模型能力。
当模型以低推理努力运行时,较小模型在较高推理努力下可以达到相当的能力,同时更易于监控。这种权衡需要额外的推理计算,称为“可监控性税”(Monitorability Tax)。
通过向模型提出后续问题并监控其生成的 CoT,可以进一步改善监控效果。这表明交互式监控可能比单次监控更有效。
OpenAI 将自家模型与 Claude 3.7 Sonnet、DeepSeek R1-0528-Qwen3-8B 和 Kimi K2 Thinking 等外部模型进行了比较。结果表明,大多数前沿推理模型都具有相当的可监控性,尽管并非完美。
OpenAI 呼吁整个行业的研究人员共同努力,尽可能长久地保持 CoT 的可监控性,并确定它能否作为未来 AI 系统的负载支撑控制层。为了实现这一目标,必须能够准确测量可监控性——这正是本研究框架的目标。
随着 AI 系统在医疗、金融、自动驾驶等高风险场景中的部署日益广泛,确保推理过程的透明性将成为构建可信 AI 的关键。未来的研究需要探索:
OpenAI 的这项研究为评估和保持链式思维可监控性提供了系统性的框架和基准。关键发现包括:CoT 监控远优于行为监控、思考时间越长可监控性越好、强化学习不会显著损害可监控性。这些结果对于开发安全、可解释的 AI 系统具有重要指导意义,也为未来的监管和治理提供了技术基础。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。