
谷歌 DeepMind 等机构提出自回归排序(ARR),用单个大语言模型直接生成排序列表,取代传统双编码器+交叉编码器的两阶段架构。实验显示 ARR 排序精度接近交叉编码器,且理论上可对任意数量文档排序。
传统搜索引擎的排序系统,长期以来依赖一种被称为「双阶段架构」的设计。这个架构由两个核心组件构成:双编码器(Dual Encoder) 和 交叉编码器(Cross Encoder)。前者负责快速从海量文档中筛选出候选集,后者则对候选文档进行精细排序。这套组合拳在工业界沿用多年,但其内在矛盾也日益凸显——速度与精度难以兼得。
近期,来自 Google DeepMind、马萨诸塞大学阿默斯特分校以及德克萨斯大学奥斯汀分校的研究团队,联合发表了一篇题为《Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders》的论文,提出用一种名为 自回归排序(Autoregressive Ranking, ARR) 的新范式,来取代现有的两阶段排序后端。这一研究如果落地,对 SEO 和 AEO(答案引擎优化)的影响将是深远的。
要理解这项研究的价值,首先需要看清现有架构的局限。
双编码器将查询和文档分别映射为向量,通过向量相似度快速检索出可能相关的文档。它的优势在于计算成本低、速度快,适合在大规模语料库中进行初步筛选。但问题也很明显:由于查询和文档在编码阶段彼此独立,双编码器无法捕捉两者之间细粒度的交互信息,排序精度存在天然上限。
交叉编码器则不同。它将查询和文档拼接后一起输入模型,能够充分建模两者之间的复杂关系,因此排序精度远高于双编码器。但代价是计算量巨大,无法直接用于全量检索。于是,工业界普遍采用「双编码器召回 + 交叉编码器精排」的两阶段方案。
这种架构虽然有效,却始终是一种妥协。研究团队提出的 ARR 模型,试图用单一的大语言模型直接生成排序后的文档列表,从而绕过两阶段架构的固有瓶颈。
ARR 的核心挑战在于:如何让一个原本用于预测下一个 token 的大语言模型,学会输出合理的文档排序?
研究团队为此设计了一种名为 SToICaL(Simple Token-Item Calibrated Loss) 的训练损失函数。它的核心思想包含两个层面:
通过这种方式,模型不仅学会了哪些文档是相关的,还学会了主动抑制不相关文档的排名。研究团队在论文中写道:「我们提出 SToICaL,一种用于大语言模型微调的广义排序感知训练损失。通过项目级重加权和前缀树边缘化,我们根据文档的真实相关性,将概率质量分配到有效的文档 ID token 上。」
研究团队在 WordNet 和 ESCI Shopping Queries 两个数据集上进行了测试,并将 ARR 与传统的双编码器、交叉编码器进行了对比。
从 WordNet 的实验来看,ARR 的表现可圈可点:
但在购物搜索测试中,问题也暴露了出来:某一版本的 ARR 方法虽然提升了整体排序质量,却在「将最相关结果排在第一位」这一指标上出现了退步。这意味着 ARR 在特定场景下的稳定性仍有待验证。
这项研究最引人注目的部分,是其对 ARR 表达能力的理论分析。
研究团队证明:双编码器若要实现对 k 个文档的任意排序,其嵌入维度必须随 k 线性增长。换句话说,随着文档数量增加,双编码器的向量空间会不堪重负。而 ARR 模型在隐藏维度恒定的情况下,理论上足以对任意数量的文档进行排序。
论文中指出:「我们为 ARR 优于双编码器的表达能力提供了理论基础。对排序所需嵌入几何的严格分析表明,双编码器要实现 k 个文档的任意排序,其嵌入维度必须随 k 线性增长。相比之下,我们证明具有恒定隐藏维度的 ARR 模型在理论上足以对任意数量的文档进行排序。」
当然,这目前仍是一个理论结果,并不意味着 ARR 在真实搜索系统中一定能达到这样的表现。但实验数据已经显示,该方法在提升排序性能、压制不相关文档方面确实有效。
这项研究传递出一个清晰的信号:搜索排序的底层架构可能正在酝酿一次范式转移。
对于 SEO 从业者而言,以下几点值得关注:
值得注意的是,自回归排序的思路并非谷歌独有。国内多家机构也在探索用大模型重构搜索与推荐系统。例如,百度 在其搜索系统中引入了文心一言大模型进行语义理解与排序增强;阿里巴巴 的通义千问团队也在探索基于大模型的召回与排序一体化方案;深度求索(DeepSeek) 则以其高效的开源模型为底座,为搜索排序任务提供了新的微调可能性。
与谷歌 DeepMind 的理论导向不同,国内团队更倾向于在真实业务场景中快速迭代。这种「工程驱动」的路径,或许能让自回归排序在中文搜索场景中更快落地。但无论如何,Search Engine Journal 等国际行业媒体持续跟踪的这类研究,对全球搜索生态的影响都值得国内从业者保持关注。
自回归排序是谷歌 DeepMind 等机构提出的一种新方法,用单个大语言模型直接生成排序后的文档列表,取代传统的「双编码器召回 + 交叉编码器精排」两阶段架构。
不会。论文本身也指出,双编码器和交叉编码器在排序环节仍将长期发挥作用。ARR 目前更多是提供了一种理论上的新范式,距离大规模工业部署还有距离。
SToICaL 是一种用于大语言模型微调的排序感知训练损失函数,通过项目级重加权和前缀树边缘化,让模型学会将概率质量集中在正确排序的文档上。
如果 ARR 类方法被采用,搜索引擎对内容语义匹配的精度要求会更高,泛泛而谈的内容更难获得排名,而直接、清晰回答用户问题的内容将更具优势,AEO 的重要性会进一步上升。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

答案引擎正在取代传统搜索成为买家研究的第一入口。本文从工具分类、买家行为迁移与评估框架三个角度,帮营销人建立AI搜索时代的可见度策略。

Common Crawl 分析超 50 万 llms.txt 文件,发现 68% 来自模板,22% 无链接,部分网站误将其当作 robots.txt 使用。文章解析数据背后的认知鸿沟,并给出正确应对 AI 爬虫的实践建议。

英国一家新闻出版商从 .co.uk 迁移至 .com 后,新闻搜索可见度在两周内暴跌 98%。该案例揭示了传统 SEO 工具与趋势新闻查询追踪系统的测量差异,以及新闻网站域名迁移中主机名信任重建的隐性挑战。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。