大模型训练数据与著作权:“合理使用”与侵权的边界在哪里?
使用受著作权保护的作品训练大模型,正在全球引发诉讼,但法院尚未形成统一的法律标准。围绕OpenAI、微软、Anthropic等公司的案件,争议集中于数据来源、复制行为、模型输出以及对原有内容市场的影响。Anthropic以15亿美元和解的案件区分了训练目的可能具有的转换性,以及从影子图书馆获取盗版书籍的违法性,但该和解并未形成具有约束力的判例。苹果据报道计划投入数亿美元购买新闻内容授权,并按实际使用量付费,这可能影响未来的授权模式,但按量付费本身并不能自动消除侵权风险。专家表示,合规审查应覆盖数据获取、清洗、训练、检索、输出和投诉处理全过程。中国目前仍缺乏成熟的训练数据授权、计量和定价机制。未来真正稀缺的,可能是高质量、独家、合法且可追溯的数据资源。
本文来源:快科技,仅供学习参考,版权归原作者所有。