全球知名的生活指南百科网站 WikiHow 已正式向美国曼哈顿联邦法院提起诉讼,指控人工智能巨头 OpenAI 侵犯版权。据路透社 8 月 25 日报道,WikiHow 在 8 月 21 日提交的诉状中指出,OpenAI 在未经许可的情况下,系统性抓取了该网站超过 11,000 篇“如何做”教程文章,并将其用于训练 ChatGPT 及 GPT 系列大型语言模型。诉状详细列出了指控内容,称 OpenAI 的大规模复制行为导致其 AI 模型能够在接收用户提示后,直接复现 WikiHow 的文本或生成高度相似的同类教程。WikiHow 强调,创作这些高质量指南需要投入大量的研究、撰写和编辑成本,而 AI 模型以极低的成本生成竞争性内容,直接侵蚀了 WikiHow 的市场份额和广告收入,长期来看可能摧毁其内容生产模式。此次诉讼涉及至少 1,200 项已注册版权的侵权行为。针对指控,OpenAI 发言人于 8 月 24 日回应称,公司模型使用公开数据进行训练是合理且合法的使用行为。WikiHow 则要求法院判令 OpenAI 赔偿经济损失,并发布禁令阻止其继续侵权。
事件分析
此案的核心争议在于将受版权保护的专有数据用于商业模型训练是否构成“合理使用”。不同于通用新闻抓取,WikiHow 提供的是高度结构化、经过人工验证的解决方案性数据,这类数据对于提升大模型的指令遵循和任务规划能力具有极高价值。OpenAI 目前的辩解仍基于“公开数据”原则,但 WikiHow 强调的“竞争性替代”逻辑(即 ChatGPT 直接生成同类内容导致原网站流量受损)可能成为法庭审判的关键变量。从产业层面看,继纽约时报、StackOverflow 之后,专业垂直类内容提供商的反击正在形成连锁反应,迫使 AI 行业正视数据确权问题,这可能加速“付费数据授权”或“数据联盟”模式的成熟。
核心观点:垂直领域数据价值重估,AI 训练需从“野蛮爬取”转向“合规付费”,版权正成为核心壁垒。
原文链接:Linux.do