
尽管 AI 在数据记忆和模式识别上远超人类,但在需要真正空间想象、抽象归纳和反事实推理的智力测试(如心理旋转、ARC-AGI)中依然表现糟糕。这些失败揭示了当前大模型依赖记忆匹配而非深度理解的本质,也凸显了人类认知在灵活性和常识推理上的独特优势。
人工智能的发展史,几乎就是一部与谜题较量的历史。早在 1959 年,IBM 计算机科学家 Arthur Samuel 就通过一篇论文推广了“机器学习”这一术语,而他所用的测试工具,正是一个会下西洋跳棋的算法。从国际象棋到中国的围棋,这些策略游戏一直是检验机器智能的经典“试金石”。
然而,谜题的价值远不止于衡量 AI 的进步速度。它更像一面镜子,清晰地反射出机器认知与人类思维之间的本质差异。尽管在 2024 年底,哥伦比亚大学的研究团队发现,当时最先进的模型在《纽约时报》的 Connections 谜题上只能答对 18%,但仅仅几个月后,部分模型已经能近乎完美地解决这类问题。这种惊人的迭代速度,恰恰掩盖了另一个事实:在另一些看似简单的问题上,AI 依然会犯下令人匪夷所思的错误。
当前的大语言模型(LLM)在空间推理方面表现出的短板尤为突出。人类建筑师或机械工程师可以轻松地在脑海中旋转三维物体,但即便是最顶尖的模型,在面对“心理旋转”这类经典智商测试题时也常常束手无策。这类题目要求判断两个不同角度的图像是否为同一个物体,对于人类而言几乎是本能,但对于依赖文本和二维像素分析的 AI 而言,却是一道难以逾越的鸿沟。
更值得玩味的是 AI 在“记忆与适应”上的矛盾。模型在训练时被灌输了海量数据,这让它们在知识问答上远超人类。但这份“博闻强识”有时反而成了累赘。2024 年,Google 与伊利诺伊大学厄巴纳-香槟分校的研究人员发现,当把经典的“骑士与无赖”(Knights and Knaves)逻辑谜题稍作改动后,模型的表现便急转直下。它们更倾向于调取记忆中的相似解法,而非重新审视题目中的新条件。同理,在名为 SimpleBench 的测试中,模型面对那些看似眼熟实则暗藏陷阱的题目时,往往会忽略关键细节,而人类则能轻易识破其中的“套路”。
这种对“表面相似性”的依赖,同样体现在抽象与视觉推理中。在著名的 ARC-AGI 基准测试里,模型需要从几个示例中推断出抽象的图形变换规则。研究表明,即使模型答对了,它们也常常是通过复杂的、不可泛化的“蛮力”规则,而非像人类那样基于简洁的视觉直觉。当图形以数字矩阵而非图像形式输入时,模型的表现会更好,这进一步印证了它们在处理纯视觉空间信息时的先天不足。
这些测试不仅仅是给 AI 挑刺,它们揭示了机器认知的底层逻辑缺陷。空间旋转的失败,说明模型缺乏对物理世界的具身理解;对变体谜题的失手,暴露了模型在“举一反三”上的机械性;而在 ARC 任务中的挣扎,则显示出模型在抽象归纳能力上的局限。
国内视角:值得注意的是,国内大模型在应对这些挑战时也面临着相似的困境。无论是百度的文心一言、阿里的通义千问,还是 DeepSeek、智谱 GLM 等模型,虽然在中文语境和特定知识问答上表现出色,但在需要真正空间想象或抽象推理的视觉谜题上,依然与顶尖海外模型一样存在明显的“阿喀琉斯之踵”。这也促使国内研究团队开始关注如何将“世界模型”或更强的符号推理能力注入到现有架构中。例如,一些团队正尝试通过结合强化学习与逻辑规则,来提升模型在 ARC 类任务上的表现,但距离人类水平的泛化能力仍有相当距离。
尽管 AI 在特定领域(如数据处理、模式识别)已远超人类,但在这些精心设计的“智力测试”面前,人类依然保有着独特的优势。我们或许无法像 AI 那样记住整个互联网,但我们拥有 AI 难以企及的直觉、常识和抽象思维能力。下一次当你觉得某个 AI 工具“不够聪明”时,不妨想想,它可能只是被一道你看一眼就能解出的“心理旋转”题难住了。
想要亲自体验这些让 AI 头疼的谜题,你可以尝试 ARC-AGI 官方网站 上的公开挑战,或者在 SimpleBench 的 GitHub 仓库 中查看其测试集。这些资源能让你更直观地感受 AI 的局限。
AI 的失败往往源于其“记忆优先”的策略。当遇到与训练数据相似的题目时,模型倾向于直接匹配记忆中的答案,而忽略了题目中细微的变化。此外,缺乏真正的空间想象力和抽象归纳能力,也是其在视觉和逻辑谜题上失手的主要原因。
ARC-AGI 是一个旨在衡量 AI 抽象推理能力的基准测试。它要求模型从少量彩色网格示例中推断出变换规则,并应用于新图形。这项测试被认为是区分“狭义 AI”与“通用人工智能”的关键挑战之一。
国内主流模型(如通义千问、文心一言等)在 ARC-AGI 等抽象推理测试上的表现与海外顶尖模型基本处于同一水平,都存在明显的短板。但在中文逻辑理解和特定行业应用中,它们往往具有本地化优势。
目前看,在涉及空间旋转、抽象归纳和反事实推理的谜题上,人类依然有显著优势。但随着多模态模型和世界模型的发展,这种差距正在快速缩小。未来,AI 完全可能在这些领域追上甚至超越人类。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI 行业今夏密集释放「突破」信号,从漏洞挖掘到数学难题,再到超级智能警告。但当领域专家入场复核,故事往往转向:夸大、剽窃指控与安全疏忽,而非文明级跃迁。

Anthropic CEO 阿莫代伊受邀与特朗普共进晚餐,这是两人首次一对一会面。在 AI 安全议题上立场相左的双方,为何选择此时对话?本文从治理碎片化、商业与安全的博弈、以及中美监管路径对比三个角度拆解这场晚宴的深层信号。

NASA宇航员克里斯蒂娜·科赫与Google高级副总裁詹姆斯·马尼卡对谈,探讨从太空回望地球的视角、宇航员与AI的共生关系,以及AI如何重新打开「我们是孤独的吗」这一古老命题。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.