|
|
爱科技、爱创意、爱折腾、爱极致,我们都是技术控
您需要 登录 才可以下载或查看,没有账号?立即注册
x
爱范儿
2026 年 8 月,一本藏着 AirTag 的书横跨美国,最后停在拉斯维加斯的一座亚马逊仓库里。
这枚 AirTag 来自科技媒体 404 Media。一名二手书商在 Biblio 平台收到一笔异常的大额订单后,配合记者把定位器藏进其中一本书。记者跟着它,找到了亚马逊在拉斯维加斯的 VGT3 设施。
在那里工作的员工说,仓库会接收大批纸质书,切掉书脊和装订,再快速扫描散开的书页。等扫描完成,原书也不可能再作为一本完整的书流通。
一家靠「把书搬上互联网」起家的公司,二十多年后,正在把那些还没进入互联网的书,一本本拆掉,变成数据。
图|404 Media AI 吃完互联网后,开始吃书了 大模型主要从海量文本中学习语言、知识,以及人类描述世界的方式。模型不断扩张,也就需要更多样、能提供新信息的训练语料。
过去很多年,AI 行业默认互联网是一个近乎无限的数据矿。网页、论坛、文库和社交平台积累了几十亿人十多年的表达,文本量大到似乎永远挖不完。
事实的确如此吗?
这座矿山还没有被挖空,容易利用的富矿却已被许多公司反复开采。今天任何一家主流模型厂商的语料库里,很可能都存着同一个网站在不同时间的抓取版本。
也就是说,互联网文本看着很多,去掉重复内容,再经过质量和来源筛选,真正能给模型带来新增信息的优质语料会明显缩水。

Epoch AI 在 2024 年发布的研究中估算,经过质量和重复调整后,公开的人类文本约有 300 万亿 token。研究还推测,按照当时的趋势,这些存量会在 2026 至 2032 年间被充分利用。
AI 当然不会马上陷入无数据可用的境地,但是能够确定的是,AI 公司想获得新的优质语料,需要付出的成本越来越高。
与此同时,新的互联网内容正在被 AI 自己污染。ChatGPT 在 2022 年底面向公众发布后,越来越多的网页、博客、评论和产品介绍由模型生成,或者人用模型辅助写出来的。它们看起来像人话,也比大多数真人写的更通顺,却很难再被当作纯粹的「人类作品」。
人类作品为什么重要?
并不是因为「人写的」天然比机器写的高级。大模型并不直接接触世界。它主要通过人类留下的文本,学习语言和知识,也学习人怎样描述和理解这个世界。

AI 内容大量进入互联网后,会带来两个问题。
模型生成内容时,往往会选择概率较高的表达和结论。来自相近模型的大量文章,也容易共享同一套措辞、知识边界和错误。
这些内容再次进入训练集,带回去的往往是上一代模型对旧资料的加工。经过多轮递归,高频模式会被继续放大,低概率的长尾内容则更容易消失。
网上的文字变多了,能给模型带来新观察和新分布的信息却没有同步增加,语料本身也就没那么「值钱」了。
另一个更隐匿的原因是,AI 生成内容进入公开网络后,下一轮网页抓取面对的不只是更多文字,以及越来越难确认的来源。人写、还是人机混写,内容越来越难区分,对于 AI 公司的数据团队而言,他们需要投入更多成本追踪来源、过滤重复并核对质量。
互联网上的文本总量迅速增加,可用的新数据却没有跟着变多。
行业里管这叫「模型坍缩」。

公共互联网越来越难处理,科技公司便开始寻找那些还没有被 AI 生成内容混入的文本——
纸质书。
一本几十年前出版、从未被数字化过的旧书,有一个今天许多网络文章已经很难证明的属性——它可以高度确定是某个人类写出来的。
设想一本 1987 年出版的地方史。内容可能早已过时,书上却有作者、出版社、版次、出版时间和 ISBN。只要能确认这个版本没有以可用形式进入既有训练集,它就能同时提供新的文本和一条清楚的来历。
早已绝版的专业手册、几十年前的小众学术著作,也有类似的价值。
再进一步,地方史会记录小城镇里的人名、地名和制度,行业手册会留下一套已经淡出主流的专业语言。这些内容在训练数据里出现得很少,模型很容易忽略它们。随着常见内容被反复复制,地方史和专业手册保存的低频知识还会进一步被淹没。

旧书会写错,严肃出版物也会留下时代的偏见。但在训练数据里,一篇被转载上百次的文章能够增加的内容,可能还不如一本少见的地方出版物。后者至少记录了模型没有见过的知识。
这个时候,一个有趣的反差出现了。
曾经,一本书值钱,是因为它的内容有价值。到了 AI 训练的语境里,一本旧书值钱,它还会因为来源可靠、未经生成式 AI 介入而受到重视。
这些旧书最稀缺的地方,未必只是写得多好,也包括它们来自一个尚未被生成式 AI 覆盖的年代。
人写的作品开始被标价 当「人类写的」本身成为一种可识别的数据标签,它就会被定价和采购。
过去两三年,所有人都在谈论 AI 的算力军备竞赛。英伟达的显卡、微软的核电站、Meta 的数据中心,巨头们把几百亿美元砸进 GPU 和电力里。大家都默认,人们很容易产生一种印象,只要算力够多,模型就能继续变强。
模型变强同样离不开数据。芯片可以买,也可以造,电力不够还可以建电厂。未经 AI 生成内容混入、由人类写下的优质文本,却在不断减少。

「人类作品」正在成为一种稀缺资源。
AI 公司已经在网络之外寻找这些内容。OpenAI 在 2023 年启动了数据合作计划,公开寻找「不容易在公共互联网上获得」的大规模资料,其中包括与 Free Law Project 合作取得的法律文书。它还允许机构以私有数据集的方式提供内容,用于基础模型、微调模型或定制模型。
亚马逊也不是第一家把目光投向纸质书的公司。
2025 年的 Bartz v. Anthropic 案披露了另一套已经运行的大型扫书计划。文件显示,Anthropic 曾花费数百万美元购买数百万本新书和二手书。服务商拆掉装订,裁开书页,再把纸本扫成带有可机读文字的 PDF。公司给这些文件建立书目数据,再从中挑选不同子集,加入不同模型的训练数据。
这些动作都指向同一个判断。
互联网上干净的人类文本快不够用了,谁能提前锁住这些存量,谁就握住了下一代模型的命门。
被遗忘,还是被提取 看到亚马逊切掉书脊、拆散书页的画面,人很容易产生一种本能的反感。
一家科技巨头正在批量毁掉人类留下的文化遗产。
「Rare Books」几个字又强化了这种感觉。读者很容易把它理解成珍本、孤本,或者某位重要作家留在世上的少数版本。但在旧书市场里,「稀有」有时只表示存量少、已经绝版,并不自动等于一本书具有很高的文化或收藏价值。
它可能是一本珍贵的初版书,也可能只是一本出版于 1991 年的软件操作手册。

这些书在被扫描之前,就已经在书店角落里躺了好几年,等着和成千上万卖不掉的副本一起,送进化浆池。
这某种程度上能不能算是一种「数字化」呢?
纸本在扫描中被毁掉,文字却留下了一份可以长期保存、检索和处理的副本。那些原本可能随着库存清理一起消失的内容,也因此有了新的用途。
因此这个事件就进入了一个十分微妙,也十分讽刺的状态。
这些书在人类的世界里早就死了——没人买、没人读、连作者都联系不上。它们被人类遗忘了几十年,却在 AI 时代成了最抢手的数据。
我们大概正在走进一个奇怪的时代:
一台能写论文、能写代码、能写小说的人工智能,它下一代的训练资料,正从一本本落满灰尘的旧书里,一页一页地剥出来。
作者|方俊鸣
编辑|肖钦鹏
|
|