
OpenAI 最新研究通过训练稀疏神经网络,让模型内部计算更易理解。该方法通过强制大多数权重为零,构建解耦的电路,在保持性能的同时显著提高可解释性,为构建更安全的 AI 系统提供新路径。
在当今人工智能领域,神经网络驱动着最先进的 AI 系统,但它们的工作原理仍然难以捉摸。我们并非通过显式的、逐步的指令来编写这些模型。相反,它们通过调整数十亿个内部连接(即“权重”)来学习,直到掌握特定任务。我们设计训练规则,但无法控制涌现的具体行为,最终形成的密集连接网络让人类难以解读。
随着 AI 系统在科学、教育和医疗等领域的实际决策中发挥越来越重要的作用,理解它们的工作原理变得至关重要。可解释性(Interpretability)指的是帮助我们理解模型为何产生特定输出的方法。目前主要有两种路径:
推理模型被激励在得出最终答案的过程中解释其工作步骤。链式思维可解释性(Chain of Thought Interpretability)利用这些解释来监控模型行为。这种方法立即可用:当前推理模型的思维链似乎能有效揭示欺骗等令人担忧的行为。然而,完全依赖这一特性是一种脆弱的策略,可能随时间推移而失效。
机制可解释性(Mechanistic Interpretability)是本研究的重点,它致力于完全逆向工程模型的计算过程。虽然目前实用性较低,但原则上它能提供更完整的模型行为解释。通过在最细粒度层面解释模型行为,机制可解释性可以减少假设,增强我们的信心。但从底层细节到复杂行为解释的路径漫长而艰巨。
可解释性支持几个关键目标:
在这项工作中,我们展示了通常可以训练出更易解释的模型。我们认为这是对密集网络事后分析的有力补充。这是一个雄心勃勃的赌注——从我们的工作到完全理解最强大模型的复杂行为还有很长的路。然而,对于简单行为,我们发现使用我们的方法训练的稀疏模型包含小而解耦的电路,这些电路既可理解又足以执行该行为。这表明可能存在一条可行的路径,来训练我们能够理解其机制的大型系统。
先前的机制可解释性工作通常从密集、纠缠的网络开始,试图解开它们。在这些网络中,每个神经元连接到数千个其他神经元。大多数神经元似乎执行多种不同的功能,使得理解几乎不可能。但如果我们训练解耦的神经网络呢?使用更多神经元,但每个神经元只有几十个连接?这样生成的网络可能更简单,更容易理解。这是我们工作的核心研究赌注。
基于这一原则,我们训练了与 GPT-2 等现有语言模型架构非常相似的语言模型,只做了一个小修改:强制模型的绝大多数权重为零。这限制了模型只能使用神经元之间极少的可能连接。这个简单的改变显著解耦了模型的内部计算。
在正常的密集神经网络中,每个神经元连接到下一层的每个神经元。在我们的稀疏模型中,每个神经元只连接到下一层的少数神经元。我们期望这使得神经元以及整个网络更容易理解。
我们希望衡量稀疏模型计算解耦的程度。我们考虑了各种简单的模型行为,并检查是否能够分离出负责每种行为的模型部分——我们称之为电路(circuits)。
我们精心策划了一套简单的算法任务。对于每个任务,我们将模型剪枝到仍能执行任务的最小电路,并检查该电路的简单程度。我们发现,通过训练更大、更稀疏的模型,我们可以生成能力越来越强、电路越来越简单的模型。
我们绘制了不同模型的可解释性与能力对比图(左下角最好)。对于固定的稀疏模型大小,增加稀疏性(将更多权重设为零)会降低能力但提高可解释性。扩大模型规模会推动这一边界向外扩展,表明我们可以构建既强大又可解释的大型模型。
为了具体说明,考虑一个任务:训练在 Python 代码上的模型需要完成字符串,使用正确的引号类型。在 Python 中,'hello' 必须以单引号结束,而 "hello" 必须以双引号结束。模型可以通过记住打开字符串的引号类型并在结尾重复它来解决这个问题。
我们最可解释的模型似乎包含解耦的电路,恰好实现了该算法。
在稀疏 Transformer 中,一个示例电路用于预测字符串应以单引号还是双引号结束。该电路仅使用:
模型的工作流程:
这项工作表明,通过设计更稀疏的神经网络架构,我们可以在保持模型性能的同时显著提高可解释性。这对于构建更安全、更可靠的 AI 系统具有重要意义。虽然从简单行为到复杂行为的理解仍有很长的路要走,但我们的研究为机制可解释性开辟了一条新的可行路径。
未来,我们计划探索如何将这些方法扩展到更大的模型和更复杂的任务,最终实现完全可理解的 AI 系统。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。