
AI搜索优化应优先关注第一层数据源——即有官方文档或明确合作证据、当前活跃用于RAG/接地/动作执行的渠道,如Google Search、Bing Search、Google Merchant Center、Yelp、Wikipedia和Reddit。传统网页SEO仍是AI接地的基础,而商品feed和本地商户数据正在成为交易执行的关键入口。
做搜索的人——无论是刚入行的新人,还是摸爬滚打多年的老兵——都容易犯一个毛病:视野窄化。只盯着自己熟悉的那几个渠道,忽略了AI工具正在从越来越多元的数据源中抓取信息。这个趋势并不是AI搜索时代才出现的,但AI让它变得更加尖锐。当Gemini、Copilot、AI Overviews等产品同时从网页、商品feed、本地商户信息、社区问答、新闻出版内容等不同维度拉取数据时,优化工作的复杂度确实上了一个台阶——但也因此变得更有意思。
越难的事情,越藏着拉开差距的机会。现在正是系统梳理AI工具可能优先依赖哪些数据源的好时机。Search Engine Journal(搜索引擎期刊)的Chris Green在一篇分析中,将各类数据源按当前可用性和证据强度做了分层,这套框架对从业者理解AI搜索的底层逻辑很有参考价值。
与其把数据源简单罗列,不如按"证据强度+时效性"来分层理解。Chris Green提出的框架大致如下:
第一层:已确认且当前活跃——用于RAG/接地/动作执行。 这类数据源有官方文档或明确合作证据支撑,且正在被实时调用。
第二层:已确认且当前活跃——用于训练/授权。 同样有明确证据,但主要用于模型训练或内容授权,而非实时检索。
第三层:已确认的历史数据——用于预训练。 有公开记录证明曾被用于模型预训练,但不代表当前仍在使用。
第四层:强证据/高度可能。 有合理推断但缺乏直接确认,需要保持关注。
这个分层提醒我们:不是所有数据源都同等重要。第一层最值得优先投入,因为回报最确定;第二、三层可能门槛更高或收益不确定;第四层则需要持续观察。
在所有数据源中,网页搜索发现是AI工具最直接的"接地"通道。Google的Gemini API文档明确说明,通过Google Search接地可以将Gemini连接到实时网页内容,并返回内联引用。Microsoft同样记录了Bing搜索结果被用于增强Copilot响应。这意味着,传统的网页SEO并没有过时——它只是变成了AI搜索的底层基础设施。
历史网页语料则是另一个维度。Common Crawl作为公开的网络爬取数据集,在GPT-3的训练采样混合物中占比约60%,LLaMA 1报告的比例是67%。C4作为Common Crawl的清洗衍生版本,在LLaMA预训练混合物中占15%。这些数据说明,预训练阶段对公开网页的依赖极深,但预训练数据是"冻结"的,与实时接地有本质区别。
在国内,百度搜索、搜狗搜索等同样在为文心一言等大模型提供实时网页接地能力,逻辑与Google Search grounding类似。差异在于国内产品的搜索生态更加封闭,第三方内容被引用的路径和规则与海外不尽相同,做国内AI搜索优化时需要单独研究各平台的收录机制。
商品数据源正在成为AI搜索中商业化程度最高的领域。Google Merchant Center的商家feed数据支撑着Google的购物界面,这是有官方文档确认的。OpenAI则走了一条更"智能体化"的路:商家通过安全的CSV/JSON feed共享标识符、描述、定价、库存、媒体和履约信息,让ChatGPT能够准确展示商品,刷新频率最快可达每15分钟一次。
Yelp的案例尤其值得注意。Yelp不仅将评论、照片和商户信息授权给OpenAI用于实时本地推荐,还支持"动作执行"——ChatGPT用户可以直接预订餐位、加入等候名单,或者通过"Request a Quote"在对话中联系服务商。Yelp的10-Q文件确认这些功能已经上线。这标志着AI搜索正在从"信息检索"走向"交易执行"。
国内方面,美团、大众点评的商户数据与本地生活服务深度绑定,但尚未看到类似Yelp与OpenAI那样明确的对外授权合作。抖音的本地生活feed、高德地图的POI数据,理论上都是AI助手执行本地服务动作的潜在数据源,但开放程度和调用方式与海外模式有显著差异。
在知识类数据源中,Wikipedia的地位几乎无可替代。它不仅明确出现在GPT-3披露的训练混合物中,也被LLaMA使用(2022年6-8月的数据转储,覆盖20种语言),同时还是广泛使用的实时参考/RAG语料。Wikimedia的数据许可非常清晰:主要是CC BY-SA协议,附带署名和相同方式共享的义务。
这对内容创作者有直接启示:如果你的内容能被Wikipedia引用,或者你本身就在贡献Wikimedia生态,那么你在AI搜索中的"知识权威性"会显著提升。国内对应的生态是百度百科、搜狗百科等,但开放许可和引用规范尚不如Wikimedia体系透明。
Reddit在AI搜索中的角色很特殊——它同时出现在第一层和第二层。Google与Reddit的协议不仅允许Google通过Reddit Data API获取"实时、结构化、独特的内容",还允许Reddit内容在Google产品中展示,这属于实时接地而非仅训练。同时,Google可以用Reddit帖子训练AI模型并改进搜索等服务,据报道年费约6000万美元。
但需要注意:有报道称Reddit正在考虑是否续约,因此这个数据源的稳定性需要打上问号。
国内的对标是知乎、贴吧、小红书等社区。知乎的内容在百度和微信搜索中都有较高权重,但类似Reddit与Google那样的明确API授权合作,在国内尚未公开出现。
新闻出版内容分两条路径进入AI搜索。一条是实时路径:通过搜索接地在推理时获取实时出版页面,能否被选中取决于检索选择和可爬取性。另一条是授权路径:OpenAI已与FT、Axel Springer、AP等多家出版机构建立明确的授权合作。
这意味着,对于新闻媒体而言,既要保证内容的可爬取性和结构化,也要考虑与AI公司建立授权关系。两条腿走路,才能在AI搜索时代保持可见性。
优先关注第一层数据源,即已确认且当前活跃、用于RAG/接地/动作执行的数据源,如Google Search、Bing Search、Google Merchant Center、Yelp、Wikipedia、Reddit等。这类数据源有官方文档或明确合作证据支撑,投入回报最确定。
非常有用。网页搜索发现是AI工具最直接的接地通道,Google Search grounding和Bing搜索都在为Gemini和Copilot提供实时网页内容。传统SEO做得好,等于为AI搜索打下了底层基础。
Reddit同时被用于实时接地和模型训练,Google与Reddit有明确的API合作。但Reddit是否续约存在不确定性,建议将其作为重要但需持续观察的数据源。
国内AI搜索更多依赖百度、搜狗等自有搜索生态,以及知乎、小红书等社区内容,但类似Yelp与OpenAI、Reddit与Google那样公开明确的API授权合作较少,数据源的开放性和调用规则与海外有显著差异。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Chartbeat 最新报告显示,其客户网络内 Google Search 同比降幅从 21.9% 扩大到 40.2%,搜索占页面浏览量份额两年从 9% 跌至 5%。与此同时,暗社交、直接访问与站内流量持续上行,忠实读者成为稳住大盘的关键。

谷歌R4T-Diffusion框架通过强化学习加蒸馏,把查询扇出延迟从近50秒压到亚秒级。本文拆解其三阶段架构、三重奖励机制与生产就绪信号,并分析对SEO策略的潜在影响。

Google 在 Search Console 的 Performance 报告中新增多模态过滤器,首次把 Lens、Circle to Search、图片上传等图片入口带来的流量单独拆出。本文解读其覆盖范围、无查询词的限制,以及对电商与内容站的实操价值。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.