浙杭法律信息网 案例分析 AI训练与输出分离:韩国著作权一般规则下的双阶段风险图谱

AI训练与输出分离:韩国著作权一般规则下的双阶段风险图谱

裁判状态说明

截至目前公开核验资料,韩国大法院尚未就“生成式AI训练阶段的数字化复制是否构成著作权侵权”或“AI训练是否当然属于合理使用”作出专门的终局裁判。在评估韩国著作权法下的相关争议时,必须明确区分一般性合理使用判例与生成式AI训练场景的特殊性。部分海外立法实践或行政研究报告中提及的文本数据挖掘(TDM)豁免,尚未直接纳入韩国现行著作权法成文法规范中。因此,针对生成式AI训练活动的法律评价,不能直接套用海外成文规则,亦不能将韩国既有的一般性著作权判例直接作扩大解释或外推为AI训练的当然合法依据。任何涉及数据利用与模型训练的法律论证,通常均需要结合数据来源、利用目的、作品性质、用量、市场影响、合同约定及技术措施等具体因素进行个案判断。

在韩国著作权法司法实践中,大法院关于著作物合理使用的经典裁判(例如韩国大法院2024年7月11日作出的2021다272001判决)确立了综合判断的基本结构,即在考量是否不与著作物的通常利用方式冲突且不不当损害作者正当利益时,应当综合权衡利用目的和性质、著作物种类和用途、所利用部分在整体中的比例与重要性、对当前市场、价值或具有合理可能性的潜在市场或价值的影响,并可审酌利用经过、方式等列举以外的事项。然而,该判例的原始事实并不涉及生成式AI训练、大规模数据集抓取或模型输出生成,故其裁判规则仅能作为评估一般性数字利用与合理使用界限的解释框架,而不能直接等同于AI训练的专门裁判结论。同样,大法院关于正当引用的既有裁判(例如2011도5835号判决)亦主要针对传统作品引用的辅助性与公正惯例进行阐述,无法直接推导出适用于海量数据抓取与大模型训练的通用引用例外规则。

问题场景

在当前的数字经济与人工智能产业实践中,某数据利用方或某模型运营方为了构建、优化或微调生成式神经网络模型,通常会通过网络爬虫、公开数据集采集、数据库购买或应用程序接口调用等方式,获取海量的图文、音视频及计算机代码等各类数字化作品。在此过程中,数以亿计的受著作权保护的作品被复制到本地服务器中,并进一步经过清洗、格式转换、分词、向量化嵌入等一系列深度技术处理,最终转化为供机器学习算法提取特征和参数的训练原料。这一业务场景引发了广泛的法律争议,尤其是权利人与模型运营方之间关于输入侧复制行为与输出侧生成行为合法性的对立。

在实际运营中,由于技术链条的长周期性与复杂性,某数据利用方或某模型运营方有时会将数据采集、云端存储、模型预训练、微调及商业化输出等多个环节混同处理,甚至错误地认为只要网页或平台公开可访问,或者只要未在前端设置付费墙,便当然享有将其用于模型训练的全部权利。这种将“公开查阅权”与“训练复制权”混为一谈的做法,构成了当前企业合规管理的重大隐患。由于输入侧的批量复制、长期留存与特征提取,以及输出侧可能产生的与原作品高度相似的生成物,在韩国著作权法框架下均面临着截然不同的法律评价维度,因此必须对AI训练与AI输出进行严格的阶段隔离与分别审查。

核心裁判规则

为了准确理解韩国著作权法框架下的法律风险,必须系统梳理大法院在相关经典判例中所确立的核心裁判规则。这些规则虽然未直接针对生成式AI训练,但构成了衡量数据利用行为是否构成侵权或合理使用的法定基准。首先,根据韩国大法院2021다272001判决确立的一般性合理使用判断结构,司法机关在审查某项利用行为是否符合旧《著作权法》第35条之3第1项(现行第35条之5所对应的一般性合理使用)时,必须严格遵循四要素综合考量原则,并结合利用经过与方式进行个案衡量。具体而言,该规则包含以下四个核心维度:

其一,利用目的和性质。司法审查通常会考量利用行为是否超越了单纯替代原作品的范畴,是否呈现出新的表达、意义、信息或技术功能,是否具有与原作品不同的独立目的与性质,变形程度是否达到了形成二次创作物或转换性利用所需的程度,以及该利用是否具备公共利益或非营利性质。在生成式AI训练场景下,模型运营方需要论证其数据处理是否赋予了模型抽象统计规律与参数权重的新功能,而非简单复制原作品的替代品。

其二,著作物种类和用途。考量对象作品的独创性高度、发表状态、属于客观事实型、实用型还是高度艺术创作型作品。通常情况下,纯粹文学艺术类作品享有更强的著作权保护力度,而具有工具性、功能性或高度公开性的资料在合理使用空间上可能存在不同的法律评价路径。

其三,所利用部分在整体中的比例与重要性。需要量化评估被提取、抓取或复制的文本、图像分量占原作品整体的比例,同时质性分析被利用部分是否构成了原作品的核心精华与关键表达。在大模型训练中,虽然单一样品在海量数据中所占比例极低,但整体汇聚效应构成了对海量版权作品的全面复制。

其四,对当前市场、价值或具有合理可能性的潜在市场或价值的影响。这是核心考量要素之一。司法实践将重点评估某项利用行为是否实际替代了原作品的既有市场需求,或者是否对权利人未来开发、授权同类或衍生市场的潜在经济价值造成了实质性损害。

此外,关于正当引用的司法认定,根据大法院2011도5835号判决确立的规则,判断已发表著作物是否构成正当范围内、符合公正惯例的引用时,应当综合考量引用目的、作品性质、引用内容和分量、收录方法与形态、一般读者观念及是否替代原作需求。然而,正如前文所述,这些传统裁判规则均不能被直接外推为生成式AI训练的法定豁免,模型运营方在进行法律抗辩时必须承担严格的举证责任。

争点拆解

在韩国著作权法的一般框架下,评估生成式AI项目的法律风险需要将整个业务生命周期拆解为若干核心争点。通过细致的争点拆解,某数据利用方、某模型运营方及某权利人能够清晰识别不同环节的合规触点:

争点一:输入侧(训练阶段)的数字化复制权与汇编权冲突。大模型训练的首要步骤是将互联网上的公开数据下载至本地服务器并进行结构化存储。在韩国著作权法中,未经授权的数字化临时复制或永久性复制原则上属于著作权人专有复制权的控制范围。尽管利用方可能主张服务器内部的自动缓存、特征提取或临时技术处理具有技术中立性,但由于缺乏明确的成文TDM豁免,法院通常会严格审查这种复制行为是否超出了合理使用或技术性临时复制的法定期限与必要范围。

争点二:模型训练过程中的“转换性”认定边界。在主张合理使用抗辩时,某模型运营方通常会强调神经网络在学习过程中将海量文本、图像打碎为统计向量,并未直接向公众展示原作品。然而,韩国司法机关在审查变形程度与独立目的时,往往不仅关注技术实现手段,更加关注模型最终呈现的功能是否对原作品构成了实质性替代。如果训练集的高密度采集导致模型输出能够精准复现原作品的实质性表达,则“转换性”抗辩极难获得支持。

争点三:市场替代效应与权利人正当利益的损害评估。根据大法院2021다272001判决的精神,评估市场影响时必须考察当前市场与具有合理可能性的潜在市场。在生成式AI产业中,如果某模型运营方通过免授权抓取训练数据,最终开发出能够替代原作者、插画师、媒体机构或程序员创作服务的商业化AI产品,并在同一商业赛道上与原权利人形成直接竞争,这将被司法机关认定为对权利人潜在市场价值的严重不当损害,从而阻断合理使用抗辩的成立。

争点四:输出侧(生成阶段)的雷同性与实质性相似侵权。AI训练与输出必须分开审查的另一个核心原因在于输出结果的不可控性。如果某第三方或用户在使用大模型时,模型输出了与训练集中的某特定受版权保护作品构成“实质性相似”的文本、图像或代码,且该输出并非偶然巧合,则某模型运营方可能因生成和传播侵权输出物而承担直接侵权或间接侵权责任。输出阶段的侵权判定直接取决于模型生成机制是否具备有效的版权过滤与防范技术措施。

韩国法路径

面对生成式AI训练数据与版权合规的复杂挑战,韩国现行法律体系与监管路径呈现出“在现有一般性著作权框架内寻求个案平衡”的鲜明特征。由于韩国国会及立法机关尚未正式颁布类似于欧盟单一数字市场版权指令(CDSM Directive)中成文TDM例外条款的专门立法,司法机关与行政主管机关(如韩国著作权委员会)目前普遍采取“回归基本法理、强化合同约束、倡导自律规范”的综合路径。

首先,在司法适用路径上,当某权利人针对某模型运营方提起著作权侵权诉讼时,案件的审理将完全遵循韩国著作权法关于复制权、改编权、展览权、公开传播权等传统专有权利的边界规定,同时由被告(数据利用方)就其主张的合理使用抗辩承担举证责任。法官将严格依照大法院2021다272001判决确立的四要素平衡标准,逐一核查利用目的、作品独创性、用量比例及市场替代效应。任何试图将国外学术讨论或行政研究资料直接作为韩国司法裁判依据的尝试,在严谨的诉讼程序中均不具法律效力。

其次,在行政与行业合规路径上,韩国相关监管与研究机构近期发布的指导意见及行业白皮书,普遍建议企业在开展生成式AI研发时,应采取“事前授权、分阶段审查、技术过滤与争议解决机制前置”的合规组合拳。例如,通过推行标准的数字版权许可协议、建立可信的数据清洗管道、尊重网站的robots.txt协议及访问控制条款、在模型输出端嵌入版权过滤防护网等。这种行政倡导与司法审慎认定的结合,构成了当前韩国法律环境下防范AI版权风险的核心路径。

证据与履约留痕

在涉韩生成式AI业务的合规管理与潜在诉讼应对中,证据链的完整性与履约留痕的严密性往往决定了法律责任的归属。某数据利用方、某模型运营方在日常运营中,必须建立覆盖数据全生命周期的可审计证据档案。具体而言,证据与履约留痕体系应当涵盖以下几个关键维度:

其一,数据来源与采集路径的溯源证据。企业必须详细记录每一批次训练数据的原始获取渠道、抓取时间、抓取时的网页前端提示、服务条款(Terms of Service)以及robots.txt文件的抓取日志。如果数据来源于第三方数据集供应商或数据库授权商,必须留存完整的商业合同、授权确认书、权利保证条款及付款凭证,以证明其获取行为具备合法的合同基础或符合善意信赖原则。

其二,技术合规与限制措施遵守的日志记录。企业应当针对爬虫程序设定严格的遵守规范,记录技术团队在抓取过程中如何识别和尊重权利人的拒绝爬取声明(如Opt-out声明、特定元标签、访问频率限制等)。同时,对于数据清洗、去重、脱敏及特征提取等内部技术处理环节,应当保留详细的操作日志与版本控制记录,以证明其数据处理行为的必要性与技术规范性。

其三,内部合规审查与风险评估的留痕。企业在引入大规模训练数据集之前,应当由法务与合规团队进行预先审查,并形成书面的合规评估报告。对于存在版权争议高风险的垂直领域数据(如专业艺术作品、畅销小说、付费数据库等),应当留存明确的风险警示记录、剔除决议或补充授权文件。

其四,输出端监控与侵权客诉处理记录。针对模型生成阶段,企业需建立完善的输出内容审核日志、用户投诉响应记录及版权侵权通知-移除(Notice and Takedown)处理档案。当某权利人向平台发出侵权通知时,企业应当完整记录接收时间、核查过程、处理结果及对涉嫌侵权输出的屏蔽或调整记录,从而在发生争议时充分证明其已尽到合理的注意义务与法律救济配合义务。

企业预案或处理设计

基于韩国著作权法的一般裁判规则与双阶段风险图谱,在韩国市场开展业务或面向韩国用户提供生成式AI服务的企业,必须建立系统化的企业法律预案与合规处理设计。科学的预案设计应当将风险管控贯穿于AI模型研发与运营的全过程:

第一阶段:输入侧数据治理与分级分类预案。企业应当在模型训练前夕建立数据白名单与黑名单机制。对于明确禁止爬取、标注版权归属清晰且具有高商业价值的专有数据库,坚决实行硬性规避或主动购买商业授权;对于公开网络数据,建立自动化的版权风险扫描与过滤管道。同时,应当在企业内部制定针对数据供应商的尽职调查标准作业程序(SOP),一旦发现供应链数据存在版权瑕疵,立即启动紧急切断与替代数据清洗程序。

第二阶段:研发过程中的技术隔离与记录留存预案。在模型训练与微调阶段,研发团队必须严格记录训练集的构成比例、数据权重及特征提取方式。若遭遇权利人针对训练行为的质询或法律函件,合规团队能够迅速调取对应的技术参数与数据溯源证明,进行精准的抗辩准备或和解谈判。

第三阶段:输出侧内容过滤与应急响应预案。由于生成式AI输出结果可能触发实质性相似侵权,企业必须在模型架构中嵌入多层输出过滤机制,包括关键词黑名单、版权指纹比对、实时水印嵌入及语义雷同检测。同时,应当设立专门的版权合规客诉通道,制定标准化的“通知-移除”应急响应流程。当接到某权利人的正式侵权异议时,应当在法定时限内迅速核查并采取技术隔离或输出阻断措施,最大程度降低恶意索赔或扩大损失的法律风险。

合规清单

为了便于企业法务与合规人员在实际操作中对照落实,以下结合韩国著作权法的一般规则与双阶段风险图谱,整理了一套系统化的合规操作清单:

合规维度 核心检查要点 具体操作与履行要求
数据来源合规 采集渠道与授权状态核实 核查训练数据是否通过合法渠道获取,确认是否签署明确的授权协议或符合公开数据库的使用条款。
技术访问合规 爬虫协议与反爬机制遵守 确保数据抓取行为严格遵守网站robots.txt协议、访问频率限制及平台前端公示的禁止爬取声明。
输入侧复制审查 临时复制与特征提取必要性 评估服务器内部临时复制与向量化处理是否超出合理使用或技术性缓存的必要范围,防范盲目全量抓取。
转换性与市场评估 替代效应与潜在市场影响 评估模型训练是否创造了独立的新表达与新功能,确保其不会不当损害原作品当前或潜在的商业市场价值。
输出侧过滤机制 实质性相似与版权防范 在模型输出端部署版权指纹比对、雷同检测及关键词过滤技术,防止生成与训练集原作品实质性相似的内容。
争议响应机制 通知-移除与客诉留痕 建立标准化的版权异议接收与处理流程,完整记录权利人通知、核查过程及应急隔离操作的审计档案。

通过上述合规清单的逐项对照与闭环落实,某数据利用方、某模型运营方能够在缺乏专门成文TDM豁免的韩国法律环境下,最大程度降低因输入侧全量抓取或输出侧内容雷同而引发的著作权侵权法律风险。

判例依据与延伸阅读

  1. 韩国大法院2021다272001判决新闻通稿
  2. 韩国国家法令信息中心大法院2021다272001判决书全文
  3. 韩国版权委员会《人工智能学习和版权限制》研究资料
  4. 韩国法制研究院《人工智能学习数据的利用与著作权限制》报告

结语

综上所述,在当前韩国著作权法未确立专门成文TDM豁免且大法院尚未就生成式AI训练合法性作出终局裁判的司法环境下,任何涉韩生成式AI业务均面临着输入侧与输出侧交织的双阶段合规挑战。大法院在既有裁判中确立的一般性合理使用四要素综合平衡规则,明确要求数据利用方和模型运营方必须对利用目的、转换性、用量比例及市场替代效应进行审慎的个案评估。企业在开展数据抓取、模型训练与商业化输出的全生命周期中,必须彻底摒弃“公开即可随意训练”的侥幸心理,建立起涵盖数据溯源、技术合规、合同保障、输出过滤与争议留痕的立体化合规治理体系。唯有通过科学的分阶段风险管控与严密的履约证据留痕,相关主体方能在瞬息万变且日趋严格的涉外法律环境中实现稳健可持续的发展。

涉韩法律咨询

如需就本文议题寻求专业法律意见,欢迎联系方莹律师:

  • 专业律师:方莹 律师(방영 변호사)
  • 执业机构:浙江浙杭(钱塘区)律师事务所
  • 执业证号:13301202511910503  |  专利代理师备案号:3332834608.9
  • 咨询热线 / 微信:13626651163
  • KakaoTalk:01059061163
  • 电子邮箱:tzzjrmfyfy@163.com / fannifong@naver.com
  • 办公地址:浙江省杭州市钱塘区金沙大道600号杭州东部国际商务中心1805号
  • 工作时间:周一至周五 09:00–18:00(北京时间)

Leave a Reply

您的邮箱地址不会被公开。 必填项已用 * 标注

Related Post

韩国商标确权行政诉讼的案件构造与审查规则韩国商标确权行政诉讼的案件构造与审查规则

本文围绕韩国商标确权行政诉讼的案件构造,探讨特许审判院审判决定、法定事由与审查时点的核心逻辑,结合大法院与特许法院判例分析诉讼边界、实体要件与证据一致性要求,为企业争议解决与合规审查提供一般法律参考。

【案例分析】中韩跨国婚姻财产保全战:如何防止韩方配偶在离婚诉讼前转移房产?【案例分析】中韩跨国婚姻财产保全战:如何防止韩方配偶在离婚诉讼前转移房产?

在跨国离婚诉讼中,韩方配偶恶意转移婚内房产怎么办?方莹律师通过真实案例详解如何在韩国法院迅速申请不动产假扣押(가압류),成功保全中国当事人合法财产份额。

涉韩企业合规:董事和高管利用公司机会的反舞弊审查涉韩企业合规:董事和高管利用公司机会的反舞弊审查

本文聚焦涉韩企业反舞弊治理,围绕董事和高管利用公司机会的核心争议,结合大邱高等法院2021노414判例与韩国商法,系统解析现实具体业务机会的认定、忠实义务、证据证明标准及企业合规预案设计,为跨境企业防范治理提供实务参考。