如果你觉得 AI 版权官司只是「作者 vs 科技公司」的拉锯战,那昨天的一纸诉状会告诉你——真正的风暴才刚刚开始。
上周五晚,Sony Music Publishing、Warner Chappell Music 及其关联公司在内的 35 家音乐出版商,联合向加州北区联邦法院提交了一份 48 页的诉状,被告不是别人,正是 Anthropic——以及它的 CEO Dario Amodei 和联合创始人 Benjamin Mann。
诉状原文用了一个极具冲击力的词:
「历史上规模最大、最明目张胆的知识产权盗窃案之一。」
这不是修辞。这是实打实的法律指控。
35 家出版商联合行动,个人被告的罕见姿态
这场诉讼的规模本身就值得关注。35 家出版商联合行动,背后是 Sony Music Publishing(全球第二大音乐出版商)和 Warner Chappell Music(全球第三大)的核心推动。它们没有只告公司——而是把 CEO 和联合创始人列为个人被告,这在 AI 版权诉讼中极为罕见。
诉状指控 Anthropic 进行了「一场无耻的大规模非法种子下载、爬取和下载盗版作品的活动」,用于训练其 Claude 系列模型。
具体来说,原告要求:
- 每件侵权作品最高 $150,000 的法定赔偿
- 每项删除版权管理信息的违规行为最高 $25,000 的赔偿
- 寻求法院禁令,阻止 Anthropic 继续使用这些作品
考虑到「数万件」受版权保护的音乐作品(歌词、乐谱、衍生作品)被卷入,索赔总额轻松达到数十亿美元级别。
不只是歌词 — Anthropic 的「数据供应链」被拆解
这场诉讼最有趣的地方,在于它不是简单地说「你用我的歌词训练了模型」,而是把 Anthropic 的数据获取管道从头到脚拆了个遍。
根据诉状,原告指控 Anthropic 做了以下几件事:
-
从盗版图书馆 LibGen 和 PiLiMi 种子下载了至少 700 万本书。注意,这里的关键不是「用书训练模型」,而是「下载」这个行为本身——即使用来训练的是正版授权数据,未经授权下载盗版文件本身就是独立的版权侵权。
-
从 MusixMatch、LyricFind 等授权歌词平台爬取内容,未经出版商同意,违反了这些平台的服务条款。
-
使用了 Books3、The Pile、Common Crawl 等数据集,这些数据集据称包含大量未经授权的受保护内容。
-
扫描并销毁了二手乐谱和歌本收藏——是的,纸质书也没放过。
-
利用「合成数据」绕过版权限制:这是最精彩的部分。Anthropic 曾公开否认直接使用 LibGen 和 PiLiMi 的书籍训练商业 Claude 模型,但诉状指出——这个否认取决于 Anthropic 如何定义「训练」。原告指控 Anthropic 至少训练了一个商业 Claude 模型,用的数据是由一个非商业模型生成的合成数据,而这个非商业模型本身是从 LibGen 和 PiLiMi 的文本中学习出来的。他们还指控 Anthropic 用这个模型给商业 Claude 模型提供强化反馈。
换句话说:你没有直接吃禁果,但你把禁果打成汁再喝——法院不接受这个文字游戏。
似曾相识:Anthropic 已经输过一次
这套剧本,我们见过。
2025 年 9 月,Anthropic 同意支付 15 亿美元,与作者和出版商就使用盗版书籍训练 AI 达成和解——这是美国历史上最大规模的版权和解案。2026 年 7 月,联邦法官正式批准了这笔和解,Anthropic 向数千名作者支付了约每本书 $3,000 的赔偿。
那次案件中压垮 Anthropic 的,不是「用版权数据训练」本身,而是通过非法种子下载获取数据的行为。Sony-Warner 的诉讼瞄准的正是同一个弱点。
诉状中引用了一首「All I Want for Christmas is You」——当 Claude 被问到「给我 Maria Carey 的歌词」时,它能够逐字输出完整的受版权保护的歌词。这是不可辩驳的证据。
IPOs 前的阴影
这场诉讼的时间点耐人寻味。
据 Financial Times 报道,Anthropic 正在筹备 IPO,投资者讨论的估值高达 $2 万亿。如果成真,这将是历史上规模最大的 IPO 之一。
但一个面临 15 亿美元和解 + 35 家出版商联合诉讼 + 多项版权官司缠身的公司,如何向投资者解释法律风险?
更麻烦的是,这起诉讼不是孤立的。Concord、Universal Music Publishing、ABKCO Music & Records 都在单独起诉 Anthropic 涉及歌词侵权,BMG 也提交了涉及 Bruno Mars、Ariana Grande、Rolling Stones 等艺人的作品索赔。
写在最后
Anthropic 的回应很简短:「我们不同意出版商的指控,我们将积极在法庭上捍卫自己。」
但问题不在于 Anthropic 是否「愿意」辩护——而在于它已经没有可辩护的空间。2025 年的和解案已经为「非法种子下载训练数据 = 版权侵权」建立了法律先例。现在,35 家出版商只是在同一个框架下,塞进了更多的作品和更高的索赔金额。
对 AI 行业来说,这场诉讼传递了一个更清晰的信号:训练数据的「灰色地带」正在快速消失。 无论是书籍、歌词、代码还是图片——如果你不能证明数据来源的合法性,你的商业模式就是有风险的。
而当一个价值 $2 万亿的 IPO 站在法律风险的天平上时,压力就不只在 Anthropic 身上了——整个 AI 行业都在看着这场审判。
📌 延伸阅读:《彻底决裂!OpenAI 切断 Cursor 模型访问,Musk $600 亿收购引爆 AI 界最大恩怨局!》 — AI 公司的另一场法律与商业风暴。