万维读者网>世界军事论坛>帖子
大模型终于露出了最原始的獠牙:它们开始吃纸了!
送交者: 员外 2026-09-24 08:35:30 于 [世界军事论坛]

如果你最近去过东京的神田神保町——那个被誉为世界最大古书店街的地方,可能会注意到一种极为诡异的景象。

这里的古书店主们,接待了一批奇奇怪怪的“大客户”。

他们既不是戴着老花镜的老学者,也不是搞文献收藏的富豪,更不像任何一种人类读书人。

他们买书不挑作者,不看名气,不选装帧,甚至不计较品相。从昭和时代的地方志、几十年前的法学判例集、早已淘汰的旧医学手册,到极其枯燥的农业生产统计小册子,只要是带字的,他们统统照单全收。

有店家一天就被扫走上百本,有的店铺累计卖出了上千册。买家注册的账号名称五花八门,但包裹最终的送达地址,却全都指向了同一个跨境物流中转站。

直到日本媒体追查发现,自去年以来已经有超过50吨日本二手书籍被出口到了美国,大家才恍然大悟:这根本不是什么书虫在淘宝,而是一场跨国算力巨头发起的“纸质文明大清剿”。

按一本书500克粗算,50吨相当于整整10万册纸质书。那些藏在书架深处、落满灰尘的纸质知识,正在被整箱整箱地塞进集装箱,运往大洋彼岸。

顶尖的高科技AI公司,怎么突然对古董摊上的“破纸”产生了如此饥渴的食欲?

答案既科幻又讽刺:在吞噬了几乎整个互联网之后,大模型终于没饭吃了。它们开始“吃纸”了。

一、互联网被“蹭秃”了,大模型面临断粮危机

过去几年,人工智能的进化逻辑简单粗暴:大力出奇迹。只要模型够大,数据够多,AI就能越来越聪明。硅谷的爬虫机器人像蝗虫过境一样,把全球网页上的维基百科、论坛贴吧、新闻报道、甚至社交平台上的吵架纪录全给吃了个遍。

但人类在网络上留下的字,毕竟是有限的。

权威AI研究机构 Epoch AI 曾发布过一份让人后背发凉的预测报告:按照目前大模型训练数据的消耗速度,互联网上积累的高质量人类文本数据——大约在数万亿至数十万亿 Token 之间——将在2026年前后彻底耗尽。

这就是让硅谷所有首席科学家夜不能寐的“数据墙”(Data Wall)。

比“没书吃”更可怕的是“吃毒药”。如今的互联网,早已不是那个纯洁的知识海洋,而是充斥着各种由AI批量生成的营销号文章、SEO垃圾信息和水军废话。如果大模型继续纵容爬虫在现在的网络上“拾荒”,就会陷入极其可怕的“模型塌陷”(Model Collapse)。

英国剑桥大学和牛津大学的研究人员在《Nature》上发表的论文证实:如果让AI用AI生成的数据来训练自己,只需要迭代几代,模型的输出就会彻底沦为毫无逻辑的呓语。这就像让一个画家只临摹画册的复印件,复印件再复印,几代之后,画面就只剩下模糊不清的噪点。这种“算力近亲繁殖”会导致AI智力急速衰退。

面对即将见底的网络数据库和遍地有毒的垃圾信息,硅谷巨头们放眼全球,猛然发现:最纯净、最具有逻辑深度、绝未被AI污染过的“高蛋白粮源”,居然全部静静地躺在那些没有被数字化的实体纸质书里。

二、从“优雅爬虫”到“工业斩首”:硅谷的物理拆书术

既然互联网的数据榨不出来汁了,那就只能对实体书下手。

你可能以为AI公司买书回去,是安排一排工作人员坐在桌前,小心翼翼地翻页扫描?那太低估科技新贵们对效率的狂热追求了。在硅谷,把纸质书变成训练集的过程,充满了工业时代最原始的暴力美学。

此前就有外媒曝光过 AI 独角兽公司 Anthropic 的经典操作。为了快速获取海量高质量图书文本,他们建立了极其凶残的“图书数字化流水线”:

巨头们买来成吨的实体图书,甚至根本不看内容,直接送进工业级切纸机。随着铡刀轰然落下,珍贵的书脊被瞬间切掉,一本本厚重的著作瞬间化为几百张散落的单页。

随后,这些纸张被塞进高速工业扫描仪,以每分钟几百页的速度狂飙,转化成高分辨率图像。紧接着,最新的 OCR(光学字符识别)视觉大模型接手,将图像中的文字、排版、表格瞬间提取为结构化的数字文本。

什么叫硬核数字化?这就叫“拆书炼丹”。

一本凝聚了作者半辈子心血的著作,在流水线上只需几秒钟,就会经历从物理消亡到数字升华的全过程。书脊断裂的声音,就是大模型吞噬人类文明的嚼碎声。

三、为什么偏偏是日本的古旧书籍?

在这场全球性的“纸质文本抢购战”中,日本的二手书之所以成为硅谷眼中的“顶级A5和牛”,有着非常现实的技术逻辑。

首先,是极高的数据纯度与排版质量。日本从近代以来就拥有极其庞大的出版业,印刷工艺精良,字体排版高度规范。

这种高质感纸张和清晰的印刷,让现代 OCR 软件的识别准确率几乎高达 99.9%。相较于某些印刷质量参差不齐、扫描出来满屏糊字的其他语种旧书,日本古书简直是整理数据工程师的梦幻食材。

其次,是不可替代的“领域知识深度”。这次神秘买家扫荡的重点,包含了大量的“地方志”(地方历史记载)、过期的法律判例集、以及昭和时代的行业报告。这些东西在当年发行量极小,且极少被上传到互联网。里面记录的社会运行逻辑、人情世故、法律博弈和历史细节,是任何现代网页都提供不了的纯净逻辑链条。

当别的AI还在用网络热梗和口水话跟用户打嘴仗时,吃了50吨日本地方志和旧法学著作的大模型,其底层逻辑推理能力和知识储备,直接实现了降维打击。

最后,还有多语言能力的战略考量。要训练一个真正通晓全球文明的通用人工智能(AGI),光吃英文数据是会“偏科”的。日本作为全球第三大经济体,其语言体系中蕴含着极具特色的文化与商业逻辑,吸收这批数据,能让大模型的跨语言泛化能力大幅提升。

四、最安全的地方,竟是落满灰尘的破书

曾经,我们以为数字化是文明的终极避难所。我们把图书扫成 PDF,把照片传上云端,以为硬盘能比纸张更久远地保存人类的智慧。

结果历史开了一个巨大的玩笑:当数字世界被垃圾信息挤爆,当算力狂魔为了维持进化不得不向物理世界反向抢夺资源时,那些被我们弃之如敝履、堆在阁楼里发黄的实体纸质书,反而成了人类文明最后的“净土”。

这是一场发生在21世纪的奇特轮回。

几万亿美元估值的顶尖高科技公司,最核心的竞争壁垒,居然取决于它们能从古董摊上收走多少吨废纸。几十年前人类用油墨压进纸张里的思想,如今变成了数据中心里滚烫的电流。

当这50吨老书被扫描切碎、彻底咽进大模型的肚子里,未来的AI在与我们对话时,字里行间也许会不经意间流露出某种昭和时代的古朴肃穆,或是偏远村落的悠远历史。

这也给所有人提了个醒:在这个算力即王道、数字容易被篡改和污染的时代,最安全、最真实、最不受AI干涉的知识存储器,可能不是任何加密硬盘,而是你家书房里那本触手可及、沾着尘土的纸质书。

毕竟,只要它们还没被塞进扫描仪切掉书脊,人类就依然保留着对这份智慧最原始、最独占的解释权。

100%(2) 0.00%(0) 0.00%(0)
当前新闻共有2条评论
  为上市换道制造假象,知道中国的竞争会砸了股价  /无内容 - 跟班 09/25/26 (6)
笔  名 (必选项):
密  码 (必选项):
注册新用户
标  题 (必选项):
内  容 (选填项):