APIMart
Anthropic 15 亿美元版权和解获批

Anthropic 15 亿美元版权和解获批

法院对 Anthropic 15 亿美元版权和解给予最终批准,向图书权利人赔付、销毁盗版数据集,并确立新的训练数据规则。

模型解读

Anthropic 如今已有一份获法院批准的 15 亿美元版权协议,这改变了所有使用 AI 的人的风险算式。 我会这样概括:资金将流向符合条件的图书权利人,Anthropic 必须销毁特定的盗版数据集,而 AI 公司现在也得到明确警告——马虎的训练数据记录可能代价极其高昂。

如果你构建、采购或监管 AI 工具,以下几点值得立即关注:

  • 和解已最终生效且可强制执行

  • 符合条件的作者和出版商可提出索赔

  • Anthropic 必须遵守付款计划

  • 来自 LibGen PiLiMi 的盗版数据必须销毁

  • 训练数据追踪如今是必备项,而非可有可无的加分项

  • 基于风格的主张 在此协议之内

这个金额格外引人注目。15 亿美元 为美国的 AI 版权案件树立了一个新标杆。文章还指出,预计每部符合条件的作品赔付约 3,000 美元,若同一书名的作者和出版商都符合条件,则按 50/50 分配。

简而言之:本案关乎的是被指控从影子图书馆复制并使用受版权保护图书的行为,而非与 AI 相关的每一个版权问题。要符合条件,一部作品必须满足既定规则,包括 及时的美国版权登记 以及 ISBN 或 ASIN。除了现金基金外,Anthropic 还必须证明数据集已销毁,并接受法院监督。

对我来说,核心要点很简单:训练数据来源、许可核查和供应商审查如今是核心的 AI 风险控制手段。如果一家公司无法说明其数据从何而来,这一缺口可能迅速演变为法律和业务上的问题。

谁被涵盖,以及争议涉及哪些训练材料

哪些作者和出版商符合条件

下一个问题在纸面上很简单,但实际操作起来却很棘手:谁获得赔付,以及针对哪些书。

和解集体涵盖了据称从 LibGen 和 PiLiMi 下载的某些图书的权利人。要符合条件,一本书必须具备 及时的美国版权登记 以及 ISBN 或 ASIN。如果一部作品缺乏及时的美国版权登记,或没有 ISBN 或 ASIN,就被排除在外。

有一个细节在这里非常重要:同一书名的作者和出版商都可以向该基金提出索赔。 因此一本书可能引出来自两个权利人的两项独立索赔。这改变了 15 亿美元 基金的分配方式,也可能推高索赔的总数量。

据称使用了哪些作品和来源

这些集体规则不只是厘清资格问题,还划定了所指控训练语料的边界。

本案的核心是这样一项指控:Anthropic 从 LibGenPiLiMi 下载了受版权保护的图书,并在未经许可的情况下用于训练。针对 AI 开发者的诉讼指控其下载了 数百万份受版权保护图书的盗版副本 [1]

和解背后的版权主张

本次和解处理的是 复制和摄取 的主张。它 并未 就整体上更大的 AI 训练之争作出裁决。

更具体地说,它解决了对 Anthropic 复制、存储并在训练中使用受版权保护图书的指控。它还涵盖与移除或省略 版权管理信息(CMI) 相关的主张,以及与商业使用这些材料相关的过失、不当得利和不正当竞争。

涵盖的内容同样重要:本次和解并未解决 基于风格或体裁的主张

资格标准涵盖不涵盖
登记及时的美国版权登记无及时美国登记的作品
标识符ISBN 或 ASIN无标准标识符的作品
来源材料来自 LibGen 或 PiLiMi 的图书并非源自这些影子图书馆的图书
权利人类型作者和出版商集体定义之外的其他权利人

Anthropic 的 15 亿美元 AI 版权和解获法院最终批准

Anthropic

Anthropic 根据和解必须做什么

Anthropic 15 亿美元版权和解:涵盖与不涵盖内容及 AI 合规清单
Anthropic 15 亿美元版权和解:涵盖与不涵盖内容及 AI 合规清单

15 亿美元基金及付款方式

在资格确定之后,和解转向资金、清理和法院监督。最终批准为符合条件的权利人设立了一个 至少 15 亿美元的基金。预计每部符合条件的作品赔付约 3,000 美元。如果同一书名的作者和出版商都符合条件,该笔款项将按 50/50 分配。

数据集销毁与训练数据限制

Anthropic 还必须销毁从 LibGenPiLiMi 获得的盗版数据集及所有相关副本。它必须提交书面证明,确认有争议的材料已被销毁。

和解还要求为再训练和内部合规进行数据来源追踪。简单来说,Anthropic 必须说明训练数据从何而来,并保存经得起审查的记录。对 AI 开发者和企业而言,这将数据来源变成了一项 部署前的要求,而不是等到纠纷闹上法庭后再去处理的事。

索赔流程、付款期限与强制执行

这些义务与现金基金并列,并具有同样的效力。Anthropic 必须:

  • 通过托管账户和分期付款为和解提供资金

  • 证明数据集已销毁

  • 继续接受法院监督

如果 Anthropic 未按时付款或未能遵守规定,法院可以介入并强制执行和解。

这对 AI 开发者、集成商和企业意味着什么

训练数据合规如今已是董事会级别的风险

15 亿美元的和解 对 AI 开发者、集成商和企业而言是一个重大警示信号。如果一个模型是在来自 Library Genesis、BibliotikZ-Library 等影子图书馆的未授权数据上训练的,法律风险可能非常严重 [1][2]。这不再只是法务团队的问题。训练数据合规如今属于董事会层面的讨论议题。

在日常层面上,这意味着团队需要为数据来源、授权和合规步骤保留清晰、可审计的来源记录。在任何模型投入生产之前,工程和法务都应对许可和数据集批准进行签核 [3][4]。而且这种审查不能只停留在你自己的技术栈上。它需要在部署前覆盖 每一个供应商和每一种模态

文本、图像、音频和视频模型的许可与供应商核查

同样程度的审查也适用于文本、图像、音频和视频模型。单一的一揽子批准是不够的。每个模型都应单独审查,明确核查它是如何训练的,以及有哪些权利支持其使用。在评估供应商时,要求直接披露数据来源,并在部署前确认训练数据权利已有书面记录 [3][4]

以下是一份简单的清单,帮助保持审查的一致性:

风险领域缓解措施实施工具
未授权数据审查供应商的训练披露采购 / 法务审查
输出漂移固定特定模型版本工程 / DevOps
PII 泄露屏蔽或脱敏输入AI 网关 / 代理
合规保留提示词和输出审计日志治理层

使用 APIMart 集中化模型治理

GccAi

如果你的团队希望更严格的控制,一个统一的 API 层可以帮助把这些核查集中到一处。APIMart 的统一 API 可以在文本、图像、音频和视频工作流中集中化访问控制、版本固定、审计日志和模型批准。当访问、日志记录和版本控制都位于同一层时,随着团队增加更多模型,就更容易避免出现缺口。

结语:关于版权、许可与 AI 风险的关键要点

Anthropic 的 15 亿美元和解 附带严格的付款条款和数据集处理规则。这是一个直白的提醒:当公司在来自 LibGenPiLiMi 等影子图书馆的未授权数据上训练模型时,可能会发生什么。这个信息相当简单:训练数据如今会带来法律和日常业务上的风险。

更宏观的一点同样清晰。AI 系统依赖训练数据运行,因此关于数据从何而来——以及是否有人获得使用许可——的问题,正在美国国内外受到越来越多的关注。

对于构建、采购或使用 AI 的团队而言,务实的做法是核查训练数据来源、记录数据集出处,并在部署前确认授权。

随着使用规模扩大,集中化治理也让工作更轻松。它帮助团队在各个部署中统一访问控制、版本管理和审计日志。

综合来看,训练数据来源、许可和模型治理如今已是核心的业务风险。

常见问题

这份和解是否让在受版权保护图书上训练 AI 变成违法?

不。这份和解 并未 让在受版权保护图书上训练 AI 变成违法。

在美国,将受版权保护材料用于 AI 训练的法律地位仍未确定。法院仍在权衡版权侵权主张与"训练属于变革性 合理使用"的论点,因此这个问题仍在争论之中。

我的公司如何核实某个 AI 供应商是否使用了经过授权的训练数据?

审查供应商的文档、服务条款和许可协议,确认它如何使用数据,以及它是否就经过授权的训练数据作出任何承诺。

对于企业用途,要寻找关于数据来源的明确保证,并确认你的输入不会被用于后续的模型训练。同时保留你自己的记录也有帮助,例如商业权利、同意日志和批准记录,这样你就有一条清晰的书面轨迹以便透明和合规。

接下来会有更多诉讼瞄准图像、音频或视频训练数据吗?

会。AI 训练数据诉讼并不止步于文本。企业已经因未经授权使用图像、音频和视频训练数据而面临诉讼。

随着 AI 模型日益多模态化,越来越多的此类争斗聚焦于被抓取、用于构建竞争性 AI 产品的创意作品。归根结底,这是内容创作者划定法律界限、要求同意或付费这一更广泛推动的一部分。

看完就试试

去模型市场挑选你想要的模型

在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。

聊天模型图像模型视频模型
进入模型市场