安妮·弗兰克案裁决与 AI 训练数据的地域性陷阱

版权的地域性特征与 AI 训练管道的全球化架构之间的不匹配,引发了一项许多知识产权管理者尚未予以定价的法律风险。基于在一个司法管辖区已进入公有领域的作品所构建的数据集,在保护期限尚未届满的邻近成员国中,仍可能构成版权侵权。欧盟法院 (CJEU) 如今作出的一项裁决,迫使 AI 开发人员必须正面应对这一地域性陷阱。
2026 年 7 月,欧盟法院针对《安妮日记》原始手稿网络发布的相关提请初步裁决案作出了判决。该案揭示了当某项作品在部分成员国受保护而在其他成员国不受保护时,在未采取地理阻断(geo-blocking)的情况下通过网站提供该作品所引发的后果。虽然该判决本身并非针对 AI,但其裁判逻辑完全适用于训练大语言模型和多模态系统的数据集。对于使用源自欧盟的数据训练模型并在欧洲市场部署这些模型的韩国企业而言,该裁决是一个不可忽视的合规信号。
正如韩国著作权委员会(Korean Copyright Commission)所指出的,安妮·弗兰克作品的版权已于 2016 年 1 月 1 日(即其 1945 年逝世 70 年后)在荷兰届满(来源 7)。然而,其原始手稿被上传至网络提供给公众。据 IPKat 报道,欧盟法院被要求对两个问题作出裁决(来源 1):
法院认定,在可从仍保护该作品的成员国访问的网站上提供该作品,即构成在该成员国内的向公众传播,即使服务器位于该作品属于公有领域的国家也是如此。决定提供该作品的人即为行为人。判决还探讨了有效的技术措施所起的作用:未采取地理阻断措施来阻止来自受保护成员国的访问,指向侵权责任的成立。相反,正如韩国著作权委员会针对该案发出的专题报告所指出的,最终用户使用 VPN 绕过地理阻断,并不能自动消除上传者未经授权的传播行为(来源 7)。
欧盟法院的裁判推理并不局限于向公众传播权。它建立在版权地域性原则的基础之上:保护的存在与范围由主张保护的各个成员国的法律决定。相同的逻辑同样适用于复制权。当开发人员从网站抓取或下载受版权保护的作品以构建训练数据集时,复制行为发生在进行复制的各个司法管辖区,或者发生在使用所产生复制件的各个司法管辖区。如果该作品在西班牙仍受保护,但抓取行为是从服务器位于作品已属于公有领域的荷兰进行的,除非开发人员确保未从西班牙访问该数据,否则该复制行为仍可能侵犯西班牙的版权。
这种地域性分割并非假设性的极端特例。对于作者于 20 世纪中期逝世的作品,70 年的“作者有生之年加逝世后”(post mortem auctoris)保护期意味着,同文本在某欧盟国家已进入公有领域,而在另一欧盟国家则可能在数年内仍受保护,具体取决于确切的逝世日期以及在全面协调前所保留的任何国家战时延长条款。包含 20 世纪欧洲文学、新闻报道或个人档案的数据集,几乎肯定会包含在整个欧盟范围内版权状态错综复杂的作品。
《欧盟人工智能法案》(EU AI Act)增加了额外的监管层。通用人工智能(GPAI)模型提供者必须根据第 53 条第 1 款第 (d) 项,使用 AI 办公室提供的模板,制定并向公众提供一份关于用于训练的内容的足够详尽的摘要(来源 2)。该模板于 2025 年 7 月 24 日发布,要求披露数据来源,包括是否使用了公开获取的数据集和抓取的数据,以及采取了哪些措施来尊重《单一数字市场版权指令》(DSM Directive)文本与数据挖掘(TDM)例外条款下的退出(opt-out)声明。欧盟法院对安妮·弗兰克案的裁决为这一透明度义务赋予了空间维度:必须在地域性背景下理解该摘要。关于训练数据在 TDM 目的下属于“合法获取”的主张,并非一个单一的布尔值答案,而是一组因成员国而异的解答。
与此同时,欧盟法院的一项并行提请初步裁决案(Case C-250/25)探讨了大语言模型(Google 的 Gemini)的输出是否侵犯了《单一数字市场版权指令》第 15 条规定的新闻出版商权利,以及模型的训练是否属于第 4 条规定的 TDM 例外(来源 5)。布达佩斯地方法院于 2025 年 4 月 3 日提交了这些问题。当欧盟法院作出答复时,其可能也会对 TDM 例外的地域范围作出界定。安妮·弗兰克案裁决已经释放出信号,即法院不会接受以“服务器所在地”作为避风港来规避地域性版权保护。
韩国企业面临着双重风险。《欧盟人工智能法案》的透明度和退出要求适用于投放欧盟市场的任何 GPAI 模型,无论提供者的设立地何在。正如韩国著作权委员会所指出的,韩国《人工智能基本法》修正案草案将为 AI 运营者引入类似义务,要求建立核实版权人作品是否被用作训练数据的程序(来源 2)。如果韩国 AI 开发人员无法按司法管辖区分别证明其在训练数据中尊重了地域性版权,将在欧洲和韩国同时面临监管风险。
安妮·弗兰克案裁决为知识产权管理者提供了一个明确的理由,要求对其训练数据集执行按司法管辖区划分的版权清算。切勿仅依赖作品在数据采集国属于公有领域这一状态。欧盟法院如今已证明,这种单一环节的核查是远远不够的。
对于训练语料库中最初在欧盟出版或创作的每个文本来源,应梳理作者的逝世年份以及拟部署 AI 模型的各个成员国所适用的版权保护期。对在部分成员国保护期已满但在其他成员国尚未届满的所有作品进行标记。针对这些作品,在训练前采取以下两项措施之一:(1) 对于将触及受保护成员国的任何使用,将该作品完全从数据集排除;或 (2) 在数据摄取和训练阶段部署有效的地理阻断措施,以防止在作品仍受保护的司法管辖区内发生复制。第二种选择需要经记录的技术控制手段,且该手段不能被轻而易举地绕过——欧盟法院对有效技术措施的提及表明,微不足道的地理阻断努力将不足以免除被告的责任。
起草数据供应协议的专利代理人、律师及交易律师,应在协议中加入陈述与保证条款,确认数据提供方已核实所提供作品在所有欧盟成员国的版权状态,并在必要时取得了许可。如果是从公开网络抓取数据,知识产权所有人必须保存抓取时所尊重的 TDM 退出协议记录(按域名细分),并记录已配置的地理阻断方案。该记录应足够详尽,以便能够披露在 AI 办公室的训练数据摘要模板中,而不会引发虚假陈述指控。
对于从事专利工作但所在机构也部署 AI 产品的韩国申请人而言,应将此视为跨职能风险加以应对。知识产权部门可以执行版权清算审查,而数据科学团队则可以构建地理阻断架构。企业内部法务合规团队如今就应使训练数据治理政策与安妮·弗兰克案裁决的地域性逻辑保持一致,而不是等待欧盟法院对 Case C-250/25 的裁决来填补剩余空白。地域性原则已经十分明确。唯一悬而未决的问题是,复制权在多大程度上会被解读为覆盖训练阶段本身——而安妮·弗兰克案裁决表明,欧盟法院对此将采取宽泛的解读标准。