AI公司,批量抢购旧书,原因竟然是...

2026-08-01 00:26:05 · chineseheadlinenews.com · 来源: 钛媒体

AI公司,批量抢购旧书,原因竟然是...

当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。

多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前“未被机器碰过”的训练数据。Anthropic的“巴拿马计划”曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。

这不仅是数据争夺战,更揭示了AI产业的核心悖论,它越成功,赖以训练的人类数据就越稀缺。

被切碎的旧书

调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁。单次订单从1000本到100万本不等,书商们销量在数月内飙升了五倍。Anthropic内部文件显示,其“巴拿马计划”(Project Panama)在一年内花费数千万美元购买了数百万本纸质书,拆解扫描后全部销毁。

为什么AI公司要花大价钱买旧书、拆书、毁书?答案指向一个它们自己制造的问题:互联网已经被AI生成内妊疼染了。

斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半(51.72%)。2022年ChatGPT发布之前,这个数字接近于零。Cloudflare的数据同样印证了一个趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。不过该数据衡量的是HTTP请求数量而非人类实际阅读量,一个AI Agent单次可访问数千页面,而人类只需几次点击。

当AI模型用AI生成的内容继续训练时,就会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上了Nature封面。研究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出还在讨论建筑,第五代跑偏到语言翻译,第九代模型开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,只用了九次迭代。



递归训练下模型输出质量的退化趋势(基于Nature 2024封面论文实验数据)

论文证明,驱动坍缩的是三类误差的复合效应:统计近似误差(有限采样丢失尾部信息)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(优化算法本身带有结构偏差)。只要其中任何一类存在,坍缩就不可避免。这是数学必然。

Epoch AI的测算给出了明确的时间窗,语言模型将在2026年到2032年间耗尽人类公开的高质量文本数据。合成数据看似是解药,微软Phi-4、谷歌Gemma等模型都已混入合成数据,但据相关研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,这是指数放大的关系。

理解了“模型塌缩”这个逻辑起点,才能理解AI公司为何愿意花数千万美元去购买那些“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。”



互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)

更棘手的是,作者们已经开始反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响但会让模型“中毒”的像素级修改。其文本领域的同类工具也在发展之中。

Nightshade自2024年发布以来已被广泛下载。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。这意味着互联网上爬取的数狙剔法保证“干净”,只有纸质书,从时间线上就天然免疫。

但问题在于:旧书虽然纯净,获取方式却触发了另一场冲突。

旧书争夺战

ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,拥有超过1.11亿本图书的目录信息。如今,它已将业务重心转向AI行业。

其官网写道:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它提供从1000本到100万本的批量采购,并承诺严格保密,每笔合作签署NDA,买家姓名永不披露。

据404 Media报道,采购订单有几个异常特征:采购对象几乎全部带有国际标准书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍不加区分;买家完全不在意价格,即使部分图书明显高于市场价,也会直接买下。

一位书商向404 Media表示,过去一周只能卖出约20本书,近几个月每周销量飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎。”

被大量买走的书大多是“长尾、冷门、几乎没有商业价值”的书籍,比如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集。这些绝版书籍因此更易被批量收购和销毁。

Anthropic的巴拿马计划提供了一个完整的标本。2024年初,该公司启动了这一严格保密的项目。内部文件写道:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力。我们不想让人知道我们在做这件事。”

此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。

今年1月的一篇报道进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,具体数量在诉讼中存在争议),并向同事转发链接附言:“真是太及时了!!!”(just in time!!!)。

CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。

具体操作流程:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描通常会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”

ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它建议客户将这一行为重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,AI公司的数字化是消耗和训练,扫描后的内容进入私有数据库,公众无法访问。

旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。

买书合法,偷书不行

2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练是“变革性”的。

他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一方面,同一法官认定该公司在启动巴拿马计划之前,曾下载了一个包含700万本盗版图书的数据库(LibGen),侵犯了版权。

2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。

这组判决传递了一个清晰的信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不拦你;但如果你从盗版网站下载,代价会极其昂贵,每本侵权作品最高可判罚15万美元。

由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。

Anthropic的律师团队提出了双重辩护:其一,基于“首次销售原则”,合法购买一本书后,所有权人有权对该副本进行任何处理;其二,叠加“合理使用”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。

7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。

与Anthropic案不同,谷歌案的核心在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内使用作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。

Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最终付出15亿美元代价;而巴拿马计划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的路径正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。

法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。

被锁进黑箱的人类智慧

这场旧书争夺战揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。

扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。

这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的内容;AI公司的数字化是为了消耗和训练,内容进入私有数据库后公众无法访问。

前者是知识的“放大器”,后者是知识的“黑洞”。

在批量采购中,AI公司是否会区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,地方史、土著语言文献、小语种著作等等,其中很多可能已经没有其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。

对中小作者而言,打击同样真实。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是看着。



几组关键数据对比

对中国AI从业者而言,挑战尤为严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数狙疼染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据,目前根本没有。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更困难的问题。

这些隐忧指向一个更根本的问题:旧书是有限的,互联网上的AI生成内容是无限的。旧书耗尽之后,AI还能去哪里?

旧书耗尽之后

即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型坍缩的速度,并没有解决根本问题。

学术界正在探索多条出路。

有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。

但这些技术路径都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾是,AI的成功正在毁掉它赖以成功的数据,会因为技术优化而消失。

我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。

当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。


    24小时新闻排行榜更多>>
  1. 胡锦涛传死讯 网曝李克强抢救画面 卫戍区司令陈源消失
  2. 俄选美小姐遭肢解,男友被发通缉令
  3. OpenAI神童拉全球股民陪葬
  4. 中国国务院发布出入境管理规定:必要时可劝阻出境
  5. “接班人”不一定是亲生的 中共再爆丑闻
  6. 办公级Agent三国杀一触即发
  7. 陕西“公公强奸儿媳案”二审维持原判 公公要求判无罪
  8. 连云港母女坠楼事件,当地应有回应
  9. 王虹得奖背后:为何超30%名校生被“空心病”缠住?
  10. 胡力任:中共军方反习派开始向社会反习势力分发武器
  11. 多瑙河见底“猛犸遗骸”浮现 热旱危机升级 席卷欧洲
  12. 人到中老年 学会九个可能帮助你延长寿命的习惯
  13. 更年期到来 燥热症状不容忽视
  14. 这个欧洲小柄不给中国免签了
  15. 特斯拉正考虑剥离中国业务?马斯克发声回应了!
  16. 热旱危机升级,席卷欧洲
  17. 美“印太安全研究所”访台 聚焦国防安全、经贸等议题
  18. 福奇的111次“沉默权”
  19. “旺旺风暴”令中共草木皆兵 大批民众撤回器官捐献意愿
  20. 阿赛顿夺回全美最贵邮编
  21. 华尔街“AI股神”7月单月亏67%
  22. 西班牙边境移民闯关酿57死 逾4.8万人返回摩洛哥
  23. 英国高等法院裁定:中国使馆新馆舍合法
  24. 西班牙百万非法移民申请合法化 意要求暂停其申根
  25. 立秋:一簪楸叶迎秋来
  26. 川普:若民主党胜选 美国恐重蜒眺班牙移民危机
  27. 蔡英文法媒专访:美国支持台湾对国际秩序意义重大
  28. 普京特使发文点赞梅拉尼娅,“你的作用至关重要”
  29. SpaceX首次财报前,估值争议的焦点
  30. 欧盟宣布扩大实施《人工智能法》
  31. 西班牙启动非法移民合法化
  32. 乌克兰前防长“拒了”意大利防长
  33. 伦敦高等法院:批准中国建“超级大使馆”决定合法
  34. 马航飞行员偷运7万粒摇头丸 尿检体内含冰毒等成分
  35. 哈马斯确认已达成解除武装协议
  36. 美国一口气拉黑43家中企,中方坚决反对
  37. 机场ICE逮捕人数增加
  38. 韩国暴跌的股市背后,一场价值43亿的婚外情
  39. 美国以涉维吾尔强迫劳动为由 再禁43家中企产品
  40. FBI突袭搜查南加州官员及中文媒体 目标指向比亚迪
  41. 这台风更凶猛 “白海豚”已达17级或直奔中国
  42. 欧足联抵制,接下来会发生什么?
  43. 美国重量级议员访台 促扩大无人机采购制造“抵御中共”
  44. 实名制是中共为电诈骗你 45公斤SIM卡找不到来处
  45. 王虹私生活被扒,前男友疑暴力
  46. 中国“黄金大外环”要来了
  47. 六旬母亲借身份证进厂了
  48. 中共干涉他国内政 只因新西兰外长一句“滚回中国”
  49. 天价罚单后,携程被扒了个底朝天
  50. 逾1.2万磅培根未过检流入超市
  51. 南加州华人绑架撕票案 遇害者街坊目击案发
  52. 海拔4120米,大熊猫“爬”上雪豹地盘
  53. 栗战书旧部国文清落马 爆官员找时机要对习致命一击
  54. 美中贸易官员 通话 美敦促北京兑现稀土与农产承诺
  55. OpenAI遭遇网络安全漏洞 川普考虑管控人工智能
  56. 肝癌是如何肺转移的?
  57. 携程刚被罚52亿,又闹出“天价退票费”
  58. 尔湾警方:涂污13辆特斯拉男子落网
  59. 地表最强小三,离异带娃傍上百亿老头
  60. 美国务院简报,非洲地图全标错