
OpenAI News报道了GPT模型从5.1版本开始频繁使用“goblin”等奇幻词汇的现象。本文深入分析这一AI语言习惯的起源,揭示训练奖励机制如何无意中强化了特定词汇的使用,并探讨了反馈循环和解决方案。
在OpenAI News的最新报道中,一个有趣的现象引起了广泛关注:从GPT-5.1开始,OpenAI的模型逐渐养成了一种奇怪的习惯——在回答中频繁使用“goblin”(妖精)、“gremlin”(小精灵)等奇幻生物作为隐喻。这并非简单的模型Bug,而是一个潜移默化的演化过程。本文将深入剖析这一现象背后的技术细节,揭示AI语言模型如何因训练激励而意外“创造”出独特的语言习惯。
2026年4月29日,OpenAI News发布了一篇引人入胜的报告,揭示了AI模型中一个令人意想不到的“文化现象”。最初,在GPT-5.1上线后,用户开始抱怨模型在对话中显得过于亲昵,这促使研究人员对特定的语言习惯进行了调查。一位安全研究员注意到,模型在回答中偶尔会使用“goblin”和“gremlin”等词汇,并建议将其纳入检查范围。
数据很快证实了这一点:GPT-5.1上线后,ChatGPT中“goblin”的使用频率飙升了175%,而“gremlin”也增长了52%。虽然当时这一现象并未引起足够重视,但几个月后,“妖精”们以更具体、更可复现的形式卷土重来,成为OpenAI News中一个值得探讨的案例。
随着GPT-5.4的发布,用户和OpenAI团队都注意到,这些奇幻生物的引用频率出现了更大幅度的增长。这触发了新一轮的内部分析,并首次将问题根源指向了“Nerdy”(书呆子)人格设定。该人格的系统提示词明确鼓励一种俏皮、古怪的风格,其中包含以下内容:
“你是一个毫无保留的书呆子式、俏皮且睿智的AI导师……你必须通过俏皮的语言来打破做作。世界是复杂而奇怪的,它的奇特之处必须被承认、分析和享受。”
数据显示,这种“妖精”语言并非广泛流行,而是高度集中在“Nerdy”人格中。尽管“Nerdy”仅占ChatGPT所有回复的2.5%,却贡献了66.7%的“goblin”提及。这一发现让OpenAI News的分析聚焦于一个关键问题:模型训练中的奖励机制是否在无意中强化了这种语言习惯?
为了解开谜团,OpenAI的研究人员利用Codex工具,比较了在强化学习(RL)训练中包含“goblin”或“gremlin”的模型输出与不包含这些词汇的输出。结果发现,一个原本用于鼓励“Nerdy”人格的奖励信号,始终对包含这些奇幻词汇的输出给予更高评分。在76.2%的数据集中,该奖励信号都明显偏爱“妖精”相关回答。
这解释了为什么“Nerdy”人格下“妖精”频繁出现,但无法解释为什么在没有该人格提示的情况下,模型也会使用这些词汇。进一步追踪发现,当“Nerdy”人格下的“妖精”提及率上升时,无提示下的相对比例也同步增长。证据表明,这种语言习惯通过迁移学习从“Nerdy”训练扩散到了整个模型。
OpenAI News指出,这一现象揭示了一个典型的反馈循环:
通过对GPT-5.5的SFT数据搜索,研究人员发现大量包含“goblin”和“gremlin”的数据点,并进一步识别出整个“奇幻生物家族”:包括raccoons(浣熊)、trolls(巨魔)、ogres(食人魔)和pigeons(鸽子)等。而大多数“frog”(青蛙)的使用则被证实是合理的。
面对这一挑战,OpenAI采取了果断措施。在GPT-5.4发布后,团队于3月中旬退役了“Nerdy”人格。在后续训练中,移除了偏好“妖精”的奖励信号,并过滤了含有相关词汇的训练数据,从而大幅降低了这些词汇在不当上下文中出现的概率。
然而,GPT-5.5在问题根源被发现之前就已开始训练,导致其在Codex测试中仍表现出对“妖精”隐喻的奇特偏好。OpenAI员工迅速注意到了这一现象,并推动了最终解决方案的实施。
OpenAI News的这一案例为AI领域提供了宝贵的启示。它表明,模型行为由许多微小的激励因素共同塑造,而这些激励有时会带来意想不到的后果。在追求个性化和趣味性时,训练过程中的细微偏差可能导致语言习惯的“漂移”,甚至形成独特的“AI文化”。
对于开发者和研究人员而言,这一事件强调了几个关键点:
从GPT-5.1到GPT-5.5,“妖精”的演化历程不仅是一个技术奇闻,更是一个关于AI系统复杂性的深刻案例。它提醒我们,即使是最先进的模型,也可能因训练中的微小偏差而产生意想不到的行为模式。OpenAI News通过这一报道,不仅揭示了问题的根源,也为未来AI训练中的激励设计提供了重要参考。
随着AI技术的不断发展,类似的“意外演化”可能会更加频繁。如何平衡模型的创造力与可控性,将成为AI伦理和工程实践中的重要课题。而“妖精”的故事,或许只是这个漫长探索中的一个有趣注脚。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。