0近日,调查媒体404 Media揭露了AI行业里一场隐秘的“抢书大战”:多家AI公司通过中间商,在全球范围内大量收购二手纸质书,用来训练大语言模型。而这些书在扫描完成后,纸质原件往往被直接粉碎销毁。

报道称,AI公司的目标很明确——只要2022年以前出版的纸质书。因为现在网上到处是AI生成的内容,真正由人类原创的“干净”文本越来越稀缺。在线图书数据库ISBNdb已经面向AI企业推出批量采购服务,一次订单从1000本到100万本不等。有书商透露,今年4月以来,他每周的销量从大约20本猛增到几百本,涨了将近五倍。
在这场“猎书”行动中,Anthropic公司是主力之一。他们启动了代号“巴拿马计划”的项目,投入数百万美元买书,用液压切割机切掉书脊,再用高速工业扫描仪数字化,最后把纸质书粉碎销毁。虽然美国联邦法院曾认定,这种“合法购买后破坏性扫描”的做法属于合理使用,但Anthropic因为长期保存了一个包含700万本盗版图书的数据库,已被判赔偿15亿美元。

这种做法也引发了很大争议。批评者担心,大量存世稀少的绝版古籍可能因此永久消失。特斯拉CEO马斯克已经公开回应,要求他旗下的SpaceX AI团队改用非破坏性方式扫描书籍,避免切掉书脊。与此同时,谷歌也因涉嫌使用数百万本受版权保护的图书训练Gemini模型,遭到出版商联盟起诉。



当AI把人类几千年积累的纸质文化遗产当作“数据矿山”来开采时,我们该如何在技术进步和文明存续之间找到平衡?这已经是一个无法回避的问题。