Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlogSEO基础AI训练数据荒:为何科技巨头重金收购旧书,以及内容水印军备竞赛的真相
AI训练数据荒:为何科技巨头重金收购旧书,以及内容水印军备竞赛的真相
SEO基础

AI训练数据荒:为何科技巨头重金收购旧书,以及内容水印军备竞赛的真相

bingdadabingdada
August 22, 202632 reads8 min read
Quick Answer

AI公司重金收购旧书,是因为旧书包含纯净的人类创作文本,能避免AI生成内容(slop)的污染。同时,AI内容水印技术正在快速发展,但现有方案存在可被规避的局限,检测与反检测的军备竞赛将持续升级。

Key Takeaways
  • AI公司收购旧书是为获取高质量、未被AI污染的训练数据
  • 传统搜索测量体系在AI答案时代已失效,需要新的评估方法
  • SynthID已标记超1000亿AI生成图像,但文本水印仍有局限
  • Anthropic将在模型层面嵌入文本水印,欧盟法规成为全球标准
  • 水印规避工具已出现,检测与反检测的军备竞赛将持续
  • 国内AI平台通过法规和平台生态推进内容标识技术
Contents

Contents

  • 测量体系的崩塌:从确定性到混沌
  • 水印基础设施:从演示到管道
  • 猫鼠游戏:检测与规避的军备竞赛
  • 国内视角:中国AI水印与溯源技术进展
  • 常见问题
  • AI公司为什么购买旧书作为训练数据?
  • SynthID文本水印技术有哪些限制?
  • AI内容水印能被移除吗?
  • 欧盟AI法案对AI水印有何要求?
  • 国内对AI生成内容标识有什么规定?
  • 关于 Bingdada

在数字内容泛滥的今天,一个反常的现象正在发生:AI实验室开始批量购买旧印刷书籍。这些由纸张和胶水构成、本该被行业淘汰的实体书,如今却成了AI训练数据的香饽饽。ISBNdb,一家专门为AI实验室采购批量印刷书籍的中间商,直言不讳地推销:“世界上最好的AI训练数据正躺在书架上。”

这一策略之所以奏效,是因为书籍拥有一个任何提示工程都无法伪造的特性——它们印刷于AI生成内容(即所谓的“slop”)泛滥之前。因此,那些制造AI生成机器的公司,正付出真金白银来避免消化自家机器产出的内容。与此同时,整个供应商类别却在向你收取月费,让你尽可能多地生成机器输出内容,再喂给这些公司。这条供应链中,显然有人误判了形势。

测量体系的崩塌:从确定性到混沌

传统搜索的确定性足以支撑起一个行业。排名是一个位置,位置带来展示和点击,点击携带跟踪参数进入分析系统,告诉你什么转化了。你可以花几个小时争论归因窗口,但整个流程足够稳定,可以被测量。

然而,AI答案不会为任何人静止。同一个问题问两次,答案中的品牌可能就会改变。在噪声之下存在某种结构,其分布的稳定性取决于背后的语料库和探测提示词的质量。但关键在于,这种探测是合成式的——你的追踪器向API发送无菌提示词,得到的答案被剥离了真实用户会看到的上下文和个性化信息。即便得到一个完全稳定的读数,也很可能只是对错误对象的稳定读数。

一个更诚实的行业可能会就此止步。但我们的行业选择了构建仪表盘:为没有位置的系统做位置追踪,为不会在任何人会话中重现的答案做声量份额分析,并以2014年排名报告的精确度来汇报这些数据。在生产端,同样的供应商在销售本文真正关心的东西:大规模AI生成内容,针对那些系统所有者正在构建识别工具的检索系统进行优化。

水印基础设施:从演示到管道

2026年5月19日(在I/O大会上),Google宣布其隐形水印系统SynthID已标记超过1000亿张AI生成的图像和视频,以及约6万年的音频内容,验证功能将立即在搜索中推出,并在数周后覆盖Chrome。同日,OpenAI承诺在ChatGPT、Codex和API生成的每张图像中嵌入SynthID。Kakao和ElevenLabs在合作伙伴名单上;NVIDIA早些时候通过其Cosmos模型加入。

这就是溯源从研究演示变成基础设施的样子。

我能听到反对意见:那是图像和音频,而内容农场销售的是文本。没错。OpenAI的承诺仅覆盖图像,Google已发布的文本水印方案也存在已被记录的弱点。DeepMind表示,当文本被彻底改写或翻译时,检测置信度会急剧下降,而且该方法在处理简短的事实性输出时较为吃力。

很多人恰恰读到这一步,就得出结论:大规模AI文本是安全的。这很令人安慰……但也过于懒惰。而且,截至8月,这一结论已经过时。

Anthropic已签署欧盟AI法案的透明度实践准则,并公布了其计划:从2026年8月2日起发布的Claude模型,将在模型层面嵌入生成文本的水印,全球适用,覆盖API、消费者应用和云平台。法律触发点是欧洲的,但水印内置于模型中,因此布鲁塞尔的指令成为全球默认标准。Anthropic表示将帮助第三方检测水印,具体机制描述在“即将发布的技术文档”中——这句话值得细品。

他们自己的页面也指出,该标记并不认证作者身份:仅经过Claude处理、校对、翻译或整理的文本也可能携带水印。而公布的局限性是那些熟悉的老问题:重度编辑、翻译、超短段落——这始终只是已选择公开内容的局限。

开源SynthID文本仓库附有DeepMind的说明:该代码是研究论文的参考实现,“并非为生产使用而设计”,且哈希函数不提供密码学安全保证。请再读一遍,慢慢读。你能检查的版本,按Google自己的描述,并非实际运行的版本。所有自信引用已公布局限的人,引用的只是一个演示版的局限。

猫鼠游戏:检测与规避的军备竞赛

我在Google搜索质量和网页垃圾团队工作了近六年,让我省去你的悬念:Google从未公布过垃圾检测的运作方式。从未。公布机制等于交出了规避手册,而搜索史上每一个严肃的检测系统都建立在这种沉默之上。认为同一家公司现在会诚实地记录其AI文本检测方法,方便那些被检测对象,这种想法确实天真。

如果存在或将会出现能够抵御改写的文本水印或检测方法,你永远不会最先听说它或其运作原理。

规避方当然准时出现了。Anthropic宣布后几天内,一个水印移除器就出现在GitHub上,覆盖Claude、Gemini和OpenAI。其README比大多数GEO行业人士都诚实:对于统计文本水印,其方法是通过另一个模型进行重度改写,标注为“尽力而为”,并承认在供应商发布公开检测器之前,“没有任何工具能诚实地证明”水印已被移除。它甚至建议通过不同模型清洗Claude文本,以防冲洗过程重新盖章。

这就是游戏的老鼠方全貌:擦除不可见字符并希望那就是水印,针对无人能查询的检测器进行释义,以及……(原文截断)

国内视角:中国AI水印与溯源技术进展

在这场全球AI内容溯源竞赛中,中国科技公司也在积极布局。百度文心一言、阿里通义千问、腾讯混元等大模型平台,都在探索各自的AI内容标识方案。中国《生成式人工智能服务管理暂行办法》已明确要求,AI生成内容应当进行显著标识。

国内的技术路线与海外有所不同,更侧重于平台层面的标识与审核机制。例如,部分国内AI平台会在生成文本中嵌入不可见的元数据标记,或在用户界面中直接标注“AI生成”字样。同时,国内学术界和产业界也在研究更为鲁棒的文本水印技术,以应对释义、翻译等规避手段。

值得注意的是,国内AI企业更倾向于通过平台生态来管理内容溯源,而非单纯依赖模型层水印。这一差异反映了中美在AI治理思路上的不同侧重:美国更依赖技术标准与行业自律,中国则更强调法规约束与平台责任。

常见问题

AI公司为什么购买旧书作为训练数据?

因为旧书印刷于AI生成内容泛滥之前,包含高质量、纯净的人类创作文本。这些书籍数据能帮助AI模型学习更自然、更准确的表达方式,避免被AI生成的低质量内容污染。

SynthID文本水印技术有哪些限制?

根据DeepMind的公开说明,SynthID文本水印在文本被彻底改写或翻译时,检测置信度会大幅下降,且对简短的事实性输出效果不佳。此外,开源版本的代码仅作为研究参考,并非生产级实现。

AI内容水印能被移除吗?

目前存在一些规避工具,通过模型改写、释义等方式尝试移除水印,但效果并不稳定。随着检测技术的演进和更多公开检测器的发布,水印的鲁棒性有望提升。

欧盟AI法案对AI水印有何要求?

欧盟AI法案的透明度准则要求AI公司采取措施标识AI生成内容。Anthropic等公司已签署该准则,并承诺在模型层面嵌入水印,这些措施将全球适用,不仅限于欧盟市场。

国内对AI生成内容标识有什么规定?

中国《生成式人工智能服务管理暂行办法》要求AI生成内容进行显著标识。国内AI平台通常通过界面标注、元数据标记等方式履行这一义务,并积极探索更先进的内容溯源技术。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 测量体系的崩塌:从确定性到混沌
  • 水印基础设施:从演示到管道
  • 猫鼠游戏:检测与规避的军备竞赛
  • 国内视角:中国AI水印与溯源技术进展
  • 常见问题
  • AI公司为什么购买旧书作为训练数据?
  • SynthID文本水印技术有哪些限制?
  • AI内容水印能被移除吗?
  • 欧盟AI法案对AI水印有何要求?
  • 国内对AI生成内容标识有什么规定?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#内容溯源#AI水印#SynthID#AI训练数据#AI内容检测
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

AI训练数据需求爆发:Micro1年化收入飙升至5亿美元,揭示数据标注行业新格局
AI人工智能

AI训练数据需求爆发:Micro1年化收入飙升至5亿美元,揭示数据标注行业新格局

AI数据初创公司Micro1在八个月内将年度营收运行率从1亿美元推升至5亿美元,折射出AI训练数据市场的结构性爆发。文章深入分析其商业模式创新、行业争议及中美数据产业差异。

Aug 217 min read
AI文本水印真相:Anthropic揭示Claude水印机制与破解之道
SEO基础

AI文本水印真相:Anthropic揭示Claude水印机制与破解之道

Anthropic披露Claude文本水印技术核心机制:水印隐藏于词选择随机性中,基于Google DeepMind的SynthID方案演进,轻度编辑无法去除但彻底改写可破解。

Aug 167 min read
Claude水印争议:欧盟AI法案下的作者身份困境
SEO基础

Claude水印争议:欧盟AI法案下的作者身份困境

Anthropic根据欧盟AI法案为Claude文本添加水印,引发创作者与开发者争议。本文深入分析水印的技术局限、法律边界及行业实践差异,揭示其无法作为作者身份可靠证明的深层原因。

Aug 158 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment