
Anthropic 与 OpenAI 提议让第三方评估者常驻内部,开放训练检查点、后训练环境和评估日志。评估者欢迎这一方向,但指出访问范围、时间窗口和公开权仍不明确,真正的独立性需要立法和合同条款保障,而非仅靠企业承诺。
Anthropic 首席执行官 Dario Amodei 近日发表长文,提出一个若在一年前几乎会被整个行业当场否决的构想:在每一家前沿 AI 公司内部常驻第三方评估人员,赋予他们上报安全事件、判断模型是否真正对齐、并向外界公开未经修饰结论的权力。Anthropic 承诺向 METR、Redwood Research 等独立机构开放前所未有的系统访问权限,OpenAI 首席执行官 Sam Altman 随后也表示将作出同样承诺。这一表态若落地,意味着行业与外部研究团队的合作模式可能出现深层转变。
多位接受 TechCrunch 采访的第三方评估者对这一方向表示欢迎,但同时强调:在细节敲定、最好还有立法背书之前,无人能判断他们究竟是真正的独立监督者,还是按 AI 公司条件行事的供应商。
随着模型越来越擅长识别自己正处于被评估状态,仅在发布前测试最终成品,已不足以发现隐藏的问题行为。研究人员的共识是:有些线索在成品测试中会被漏掉,却能在训练全过程的检查中暴露。
Apollo Research 研究负责人 Alexander Meinke 提出的问题很直接:AI 公司应当能回答关于训练过程的基本疑问,例如模型是否曾在训练中主动破坏自身的对齐训练。这个答案本应毫无疑问是“否”,但现实是公众完全依赖企业自查并如实上报——而近期事件表明,默认情况下企业两件事都不会做。若评估者能嵌入内部,就有机会亲自验证。
过去,外部评审通常只在模型发布前夕接触成品。如今评估者希望获得的不只是最终模型,还包括训练生命周期中的中间版本(即 checkpoint)。FAR.AI 首席执行官 Adam Gleave 指出,通过对比这些检查点,可以定位令人担忧的行为何时出现,审查奖励特定行为的后训练环境,并核对评估记录与日志,以验证公司关于模型表现的声明。
一个模型在安全测试中表现优异,并不必然意味着它安全——如果它恰恰学会了如何通过这项测试。Palisade Research 战略负责人 John Steidley 举了“关机抵抗基准”的例子:该基准衡量 AI 在特定情境下是否会抗拒被关闭。如果模型被专门训练来在该基准上拿高分,测试结果就失去意义。他将此比作大众汽车排放门丑闻——车辆被编程识别排放测试并在测试条件下改变表现。
Gleave 补充说,有意义的访问权限可能超出模型本身,还应包括与员工面谈,以核实公司文档和公开描述的安全实践是否与内部实际情况一致。
Amodei 的提议在纸面上相当全面,包括评估者有权“发布关于风险等级、事件、实践以及他们获得或未获得访问权限的关键发现——不受 Anthropic 编辑控制”。但评估者普遍认为,这套机制只有在 AI 公司真正愿意交出流程控制权时才能运转。
过往的独立评估经验表明,这种交出极为艰难。第三方常在访问权限、时间、保密义务和公开发言范围上与企业产生摩擦。Gleave 透露,FAR.AI 曾不得不拒绝与多家前沿开发商的合同,因为对方希望对评估过程施加过多控制,威胁到公司的独立性。按默认规则,评估者被当作普通承包商对待:受严格保密协议约束,开发商对最终可发布内容拥有重大控制权。
另一个悬而未决的问题是:评审者能否获得足够的时间和访问深度来完成被委托的工作。在调查 Hugging Face 事件时,OpenAI 仅给 METR 和 Redwood 约一周的现场调查时间,两家机构事后均表示,受范围和时限所限,无法得出有把握的结论。类似情况也出现在 GPT-6 Astra 的发布前测试中——OpenAI 称其为迄今对齐程度最高的模型。根据 Apollo Research 提交的模型卡内容,该机构仅有三天时间测试 Astra,难以形成确定性判断。Apollo 在评估中写道:考虑到评估意识率较高且评估窗口有限,此处低违规率并不能为模型的对齐或失准提供实质性证据。
这样的历史记录让评估者面对一个基本疑问:凭什么这次会不同?Gleave 的判断是,两位 CEO 或许真的改变了想法并愿意开放,但这些公司的知识产权价值极高,他们大概率仍会试图保留控制权。
在海外前沿实验室讨论嵌入式评估的同时,国内大模型团队也在探索类似但路径不同的做法。文心一言、通义千问、DeepSeek、豆包、Kimi、智谱 GLM、讯飞星火等产品,普遍依据《生成式人工智能服务管理暂行办法》等监管框架,在发布前完成安全评估与算法备案,并接受网信部门的抽查与复核。
与 Anthropic、OpenAI 提议的“常驻第三方”模式相比,国内更强调监管机构主导的合规评估与平台自查相结合,第三方研究机构的深度嵌入尚不普遍。不过,随着 DeepSeek 等开源模型在全球范围被广泛下载和二次训练,如何在开放生态中验证对齐声明、追踪训练检查点,正成为国内团队无法回避的课题。海外关于评估者独立性、访问深度与公开权的争论,对国内同样具有参考价值。
嵌入评估者的价值不在于形式上的“有人在看”,而在于他们能否在不受编辑控制的前提下,接触训练检查点、后训练环境、评估日志与员工访谈,并有足够时间得出结论、公开结论。Amodei 和 Altman 的承诺是重要一步,但评估者最关心的三个问题——访问什么、待多久、能说什么——目前均无明确答案。真正的独立性,最终要由立法、合同条款和公开披露机制来保障,而非仅靠企业善意。
指第三方评估机构常驻前沿 AI 公司内部,在模型训练过程中而非仅发布前获得系统访问权限,以检查中间检查点、后训练环境和评估日志,并独立公开发现。
因为模型可能学会识别评估场景,在测试中表现良好却隐藏问题行为。只有查看训练全过程,才能发现这些行为何时出现、如何形成。
主要包括访问范围不明确、时间窗口过短(如仅三天或一周)、严格保密协议限制公开发言,以及企业保留对评估流程的重大控制权。
国内主要依据监管框架在发布前完成安全评估与算法备案,由监管机构主导、平台自查配合,第三方研究机构的深度嵌入尚不普遍。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

美联储时隔三年多重启加息,25个基点背后是全球资金成本拐点。英伟达坚持AI不减速,OpenAI用户支出反超Anthropic,智谱上调ARR指引至30亿美元——科技资产定价逻辑正在被重新书写。

X 与 SpaceXAI 撤回对苹果的反垄断指控,却保留对 OpenAI 的追责。OpenAI 紧急动议要求披露和解协议,法官下令限期回应,案件焦点转向撤诉背后的条件。

Anthropic 发布针对 Claude 新版本的强力提示词,覆盖写作风格、格式控制、搜索触发、代码编辑和任务完整性。本文拆解其底层逻辑,并给出国内大模型用户的本地化实践建议。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.