AI资讯industry
亚马逊批量购书扫描用于 AI 训练后销毁
核心亮点
科技媒体 404 Media 做了一期追踪实验,第一次坐实了亚马逊一项从未公开的购书行动:它批量买进大量书籍,扫描成 AI 训练素材后直接销毁。这篇报道把长期停留在传闻阶段的「书被拿去喂模型」变成了有位置数据支撑的事实。对关心内容版权的从业者来说,这无异于一记警钟。
具体能力或事件经过
记者的手法相当硬核——他们在一本珍本图书里藏了一个追踪设备,然后把书「无意间」流入市场。物流轨迹显示,这本书先进入亚马逊的收购体系,随后被送进一处人工智能训练中心。整条链路用位置数据讲得清清楚楚,不是推测,也不是匿名爆料,而是一台设备实打实走过的路。
技术细节
报道点出的关键在于「扫描后销毁」:书在被数字化之后并没有回流二手市场,而是被处理掉。这意味着亚马逊获取语料的方式,是成规模地「买—扫—弃」,而非单纯依赖已公开的数字副本,其体量和对实体书市场的占用都远超外界想象。这种运作方式几乎不留下可被追查的公开痕迹,倒逼行业重新审视数据采购链条。
与竞品对比
比起 OpenAI、Meta 等更多依赖网络抓取和授权库的做法,亚马逊这种「实体书入库再销毁」的路径更隐蔽,也更容易绕开公众视线,因为被销毁的实物不会留下二手流通的痕迹可供追查,外界很难从流通端发现异常。
行业影响或适用场景
这件事把 AI 训练数据来源的灰色地带又往前推了一步。对出版方、作者和二手书商而言,自家内容如何被悄悄收编进大模型、又是否应获补偿,正变成一个绕不开的版权与伦理问题,也可能引发新的监管关注。