Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlogSEO基础Google 最新研究揭示:AI 回答不准确,问题可能不在“知识”而在“记忆”
Google 最新研究揭示:AI 回答不准确,问题可能不在“知识”而在“记忆”
SEO基础

Google 最新研究揭示:AI 回答不准确,问题可能不在“知识”而在“记忆”

bingdadabingdada
August 18, 202661 reads7 min read
Quick Answer

Google 的最新研究指出,前沿 LLM 回答不准确的主要瓶颈在于“信息提取”环节,而非“知识储备”不足。研究发现,训练数据中“主语-宾语”的呈现顺序会显著影响模型的回忆能力,为 AI 优化和 SEO 提供了新的思路。

Key Takeaways
  • 前沿 LLM 的知识编码已近饱和,但信息提取失败是主要错误来源。
  • 训练数据中“主语-宾语”的顺序与用户提问顺序错位,会导致模型“想不起来”。
  • 增加推理时间能部分提升提取成功率,但成本高昂且需智能触发。
  • 扩大模型规模并不能有效解决信息提取的瓶颈问题。
  • SEO 内容创作可考虑按用户常用查询顺序组织关键实体,以利于 AI 理解。
Contents

Contents

  • 知识饱和与提取瓶颈:AI 的“记忆”困境
  • 主客体顺序:影响 AI“回忆”的关键变量
  • 提问方式与长尾事实:影响甚微与更难提取
  • 现有解决方案的局限与新思路
  • 对 SEO 的启示:优化内容中的实体顺序
  • 国内视角:大模型领域的“记忆”探索
  • 常见问题
  • AI 为什么会出现“幻觉”,是知识不够吗?
  • 什么是“主语-宾语”顺序问题?
  • 增加 AI 的“思考”时间能解决所有问题吗?
  • 这项研究对 SEO 有什么实际帮助?
  • 扩大模型规模能解决记忆提取问题吗?
  • 关于 Bingdada

大型语言模型(LLM)在回答问题时的“幻觉”或错误,常常被归咎于训练数据不足或模型不够聪明。然而,Google 近期发布的一项研究却提出了一个颠覆性的观点:对于最先进的 AI 模型来说,问题可能不在于它们“不知道”,而在于它们“想不起来”。

这项研究由 Google 团队完成,题为《Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality》。研究发现,像 Gemini-3-Pro 和 GPT-5 这样的前沿模型,其“知识储备”已经接近饱和,但它们在信息“提取”环节存在显著瓶颈。

知识饱和与提取瓶颈:AI 的“记忆”困境

理解这项研究,需要先厘清两个核心概念:参数化信息和提取。

所谓参数化信息,是指 LLM 在训练阶段从海量网页、书籍、代码等数据中学习并固化在神经网络权重里的知识。过去,研究者常认为 AI 回答错误是因为“没学过”。但 Google 的这项研究显示,对于前沿模型而言,事实编码率高达 95% 到 98%,意味着它们“学过”几乎所有测试过的事实。

真正的瓶颈在于“提取”。研究发现,这些模型在直接回答问题时,有 26% 到 34% 的已编码事实无法被成功调用,即使采用“思维链”等推理技术,仍有 11% 到 12% 的失败率。对于 GPT-5.2 这类更强的模型,超过 70% 的错误源于提取失败。这就像一个人明明读过某本书,却在考试时怎么也想不起答案。

主客体顺序:影响 AI“回忆”的关键变量

研究中最有趣的发现之一,是事实的编码顺序与查询的提问顺序之间的错位。

研究者用“主语”和“宾语”来定义事实的组成部分。例如,在“Oasis 乐队在 Boardwalk 俱乐部进行了首演”这个事实中,“Oasis”是主语,“Boardwalk 俱乐部”是宾语。模型在训练时,总是先看到主语,再看到宾语。

当用户提问时,如果问题的顺序与训练数据一致(例如“Oasis 在哪里首演?”),模型就能轻松作答。但如果问题颠倒了顺序(例如“哪支乐队在 Boardwalk 俱乐部首演?”),模型的“回忆”能力就会显著下降。

更值得注意的是,即使模型无法直接回答这种“反向问题”,当把答案作为选项放在多选题中时,它却能准确识别。这进一步证明了知识确实存在,只是无法被主动、灵活地提取。

提问方式与长尾事实:影响甚微与更难提取

该研究还排除了一个常见猜想:提问措辞的影响。实验表明,对同一问题换用不同的问法,对模型的回忆成功率几乎没有影响。真正起决定性作用的,是主语和宾语的顺序。

另一个值得关注的发现是长尾事实的提取难度。对于流行度高、频繁出现的事实,模型的编码和提取都表现良好。但对于那些在训练数据中较少出现的“稀有事实”,提取失败的比率显著更高。尽管编码率的差距不大,但提取率的差距却很明显。这意味着,即使是已经学到“冷知识”的 AI,也更容易在需要时“卡壳”。

现有解决方案的局限与新思路

针对提取瓶颈,研究者测试了两种潜在的解决方案,但结果都指向了局限性。

首先是增加推理时间。让模型在回答前进行更长时间的“思考”,确实能提升 40% 到 65% 的提取成功率。但代价是巨大的计算成本,且如何智能地判断何时需要“多思考”本身就是一个难题。

其次是扩大模型规模。研究明确指出,简单地堆砌更多数据和参数,并不能解决提取问题。这打破了“更大即更强”的传统认知。

对 SEO 的启示:优化内容中的实体顺序

虽然这项研究主要聚焦于 AI 模型本身,但它对 SEO 从业者同样具有启发意义。

研究暗示,LLM 在提取信息时对“主语-宾语”顺序存在敏感性。因此,一个合理的推论是:在创建内容时,如果能按照用户最常用的提问顺序来组织关键实体(即主语和宾语)的表述,可能会更有利于 LLM 理解和引用这些内容。

例如,如果用户更常搜索“Oasis 的首场演出在哪里”,那么在文章中优先以“Oasis”作为主语来构建句子,可能比反过来写更有利于 AI 的抓取。虽然这一推论尚未得到研究的直接证实,但从 AI 的工作原理出发,这是一个值得尝试的优化方向。

国内视角:大模型领域的“记忆”探索

Google 的这项研究,也为国内大模型的发展提供了参考。目前,国内的头部模型如文心一言、通义千问、DeepSeek等,也在不断提升模型的复杂推理能力。

与 Google 研究类似,国内模型在应对复杂逻辑和长文本理解时,同样面临“知识调用”效率的问题。这促使国内团队在模型架构和训练策略上进行创新,例如探索更高效的注意力机制或引入外部知识库来辅助模型进行“回忆”。如何在控制成本的前提下,提升模型对已有知识的提取能力,将是国内大模型竞争的下一个关键战场。

常见问题

AI 为什么会出现“幻觉”,是知识不够吗?

Google 的研究表明,对于前沿模型,幻觉的主要原因并非知识缺失,而是“提取”失败。模型可能已经学习了正确的知识,但在回答时无法从庞大的参数网络中准确调取。

什么是“主语-宾语”顺序问题?

模型在训练时学习事实的顺序通常是“主语在前,宾语在后”。如果用户提问时颠倒了这个顺序,模型的回忆能力就会下降。例如,模型能回答“Oasis 在哪里首演”,但可能难以回答“谁在 Boardwalk 俱乐部首演”。

增加 AI 的“思考”时间能解决所有问题吗?

不能。增加推理时间可以提升 40%-65% 的提取成功率,但会显著增加计算成本。同时,如何智能地判断何时需要“多思考”也是一个未解的难题。

这项研究对 SEO 有什么实际帮助?

它提示 SEO 从业者,在内容创作时,可以尝试按照用户最常用的搜索句式来组织关键实体(主语和宾语)的顺序,这可能有助于 LLM 更好地理解和引用内容。

扩大模型规模能解决记忆提取问题吗?

根据这项研究,不能。研究明确指出,扩大模型规模并非解决提取瓶颈的有效方案。问题的关键不在于存储容量,而在于信息访问的效率。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 知识饱和与提取瓶颈:AI 的“记忆”困境
  • 主客体顺序:影响 AI“回忆”的关键变量
  • 提问方式与长尾事实:影响甚微与更难提取
  • 现有解决方案的局限与新思路
  • 对 SEO 的启示:优化内容中的实体顺序
  • 国内视角:大模型领域的“记忆”探索
  • 常见问题
  • AI 为什么会出现“幻觉”,是知识不够吗?
  • 什么是“主语-宾语”顺序问题?
  • 增加 AI 的“思考”时间能解决所有问题吗?
  • 这项研究对 SEO 有什么实际帮助?
  • 扩大模型规模能解决记忆提取问题吗?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#Google AI 研究#LLM 信息提取#主语宾语顺序#AI 幻觉原因#SEO 优化新思路
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

AI搜索时代,Google官方表态:SEO仍是唯一通行证,GEO只是伪需求?
SEO基础

AI搜索时代,Google官方表态:SEO仍是唯一通行证,GEO只是伪需求?

Google官方近期回应了关于GEO(生成式引擎优化)的争议,明确指出AI搜索答案完全基于常规搜索索引,网站无需进行特殊优化。文章深入剖析了AI搜索的底层逻辑,并指出传统SEO仍是获取AI流量的核心。

Aug 258 min read
2026年发布者网站SEO审计:从排名到被引用的全面指南
SEO基础

2026年发布者网站SEO审计:从排名到被引用的全面指南

2026年,SEO审计的核心已从单纯的排名转向品牌在AI与搜索引擎中的全面可发现性。本文深入探讨了技术SEO、内容质量、E-E-A-T和品牌实体一致性四大支柱,并强调将审计工作与商业价值对齐的策略。

Aug 257 min read
AI内容泛滥引发平台反击:SEO从业者如何避免沦为工具的附庸?
SEO基础

AI内容泛滥引发平台反击:SEO从业者如何避免沦为工具的附庸?

AI内容泛滥引发平台集体反击,SEO从业者面临职业价值危机。文章从平台动向、历史镜鉴和实操策略三个层面,深入探讨如何将AI从"产量引擎"转变为"编辑助理",避免沦为工具的附庸。

Aug 258 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment