首页 > 汽车评测 > 汽车评测 > 为训练AI模型,Anthropic耗资数百万美元购入并“销毁”巨量图书

为训练AI模型,Anthropic耗资数百万美元购入并“销毁”巨量图书

发布时间:2025-06-28 11:33:17

6 月 26 日消息,据外媒 Ars Technica 今日报道,当地时间周一公开的法庭文件披露,人工智能公司 Anthropic 曾斥资数百万美元,将实体图书拆解并扫描成数字文件,用于训练类似 ChatGPT 的 AI 助手 Claude。为了获取训练数据,公司将大量图书拆除装订、扫描进系统,随后直接丢弃原件。

判决书长达 32 页,披露了 Anthropic 在 2024 年 2 月雇佣 Tom Turvey 的经过。Turvey 曾负责 Google Books 项目的合作事务,公司委托他“获取全世界的图书”。这一战略性人事安排,显然是希望复制谷歌曾被法院认定为合理使用的图书数字化模式。

最终,法官 William Alsup 裁定,该扫描方式构成合理使用,理由是图书已由 Anthropic 合法购买、扫描后即刻销毁,且数字文件仅限内部使用,未向外传播。他认为这类转换相当于“节省空间”的数字化转化,具有合理使用中的“转化性”特征。如果公司一开始就遵守这一路径,或许已树立 AI 合理使用的首个判例,但早期的盗版行为削弱了其合法性。

核心原因其实很简单:AI 训练需要海量优质文本。为了构建大语言模型,研究人员需将亿万词语输入神经网络,反复训练模型,建立词语与概念之间的关系。

训练数据的质量直接影响模型输出的准确性。相比网络评论等杂乱信息,编辑过的书籍和文章能显著提升 AI 的语言能力。

AI 公司急需出版内容,但通常不愿耗费时间谈授权。美国的“首次销售原则”提供了法律空间:买下实体书之后,使用者可以自行处理。这就让购买图书成为一种合法的“绕道方案”。

和许多同行一样,Anthropic 最初选择了绕过版权的捷径。IT之家从法庭材料获悉,为了绕开冗长复杂的授权流程,CEO 阿莫代伊曾主张使用盗版电子书。但到了 2024 年,出于法律考虑,公司开始寻求更安全的替代方案。

收购二手书成为理想选择:不必谈授权,又能获得质量上乘的训练文本。为了加快数字化进程,Anthropic 采用“破坏式扫描”,大量购入图书,拆封、裁剪、整批扫描为机器可读的 PDF 文件,完成后纸本全部废弃。整个流程耗资数百万美元。

该公司的购买对象大多是零售渠道的普通旧书。但事实上,非破坏性扫描技术早已成熟。比如 Internet Archive 就开发出可保留原书的数字化手段。本月早些时候,OpenAI 和微软也宣布与哈佛大学图书馆合作,计划使用近百万本公版书籍训练 AI,这些书籍在被数字化的同时依旧妥善保存。

汽车评测更多>>

特斯拉新车没有方向盘没有脚踏板:定价不超20万、不需要人开 消息称三星Galaxy S26系列手机搭载全新降噪算法 苹果iOS 26.4 Beta移除App Store退出登录功能,切换账户更繁琐 科技整活!PS5手柄直接操控大疆扫地机器人 摩托罗拉Edge 70 Fusion手机宣传图曝光:骁龙7s Gen 4芯片、6.78英寸曲面屏 开源压缩工具NanaZip 6.0正式发布:UI大改、支持更多格式 AI时代的资本弃儿:为什么高瓴加仓阿里、拼多多,却清仓了百度 趋势科普:2026年,为什么越来越多人提LE Audio 和 Auracast? 上汽集团实现筑底企稳,回升提速态势渐显,改革攻坚取得了阶段性成效 2025车坛众生相:我们在追求科技进步,还是在制造昂贵的麻烦? 外媒:福特与比亚迪洽谈混合动力车型电池合作 丰田2026:蓄力之年 捷达科技公司成都启航 剑指新能源与出海双赛道 海外加价抢购,极氪9系究竟构建了怎样的“东方豪华”竞争力? 小鹏汽车的“稳进破局”,到底要破什么局? 掌握转型主动权,北京现代如何让合资品牌“老树发新芽”? 雷军:蓝色是SU7的幸运色,绿色是YU7的幸运色 小米YU7推出7年低息政策:月供低至2593元,2月底截止 旧照太“抽象”被疑盗号?QQ辟谣沈腾空间被盗,附送账号找回指南 出圈一周年,DeepSeek的变与不变 理想L6累计交付突破36万辆,成为2025年中大型SUV销冠 曾经盛极一时的VR、元宇宙,现在怎么样了? 台积电3nm打造!OpenAI计划今年推出首款自研AI芯片 爱马仕悠悠球多地售罄 网友:1.8万的童年回忆 西方专家:中国电网一旦最终成熟,将影响全球乃至掀起能源革命 AI的尽头,也可以是储能 59岁王祖贤近况曝光!在加拿大别墅区开艾灸馆,一个人孤苦伶仃生活 旭辉境外债务重组生效 碧桂园、融创、旭辉“三巨头”化债上岸 个人销售未满2年住房增值税降至3%,300万元房源可省5万多 创作者变现将有新渠道?小红书内测笔记付费功能