据尼曼新闻实验室报道,超过340家地方新闻出版商已采取措施,限制互联网档案馆对其新闻内容的访问权限。这一行动集中在近期,主要通过更新网站的 robots.txt 协议或设置特定头部信息来实现,导致互联网档案馆的“时光机”无法有效抓取和存档这些媒体发布的最新报道。此次封锁潮背后的核心逻辑在于数据版权与商业利益的双重博弈。一方面,出版商引用近期关于数字借阅的法律判决,认为互联网档案馆的未经授权存档侵犯了其版权;另一方面,随着生成式人工智能的爆发,新闻内容被视为高质量训练数据的“金矿”,出版商试图通过封锁第三方存档来防止其内容被AI公司无偿抓取和利用,从而保护自身的商业价值。这一事件标志着互联网“开放存档”时代的转折点,如果优质内容源纷纷退守至数据围墙后,不仅会导致历史记录的缺失,也意味着未来的AI模型将难以获取真实、高质量的地方性新闻数据,可能进一步加剧AI生成内容的“幻觉”问题。
事件分析
💡 核心观点:新闻媒体的集体封锁标志着开放互联网向“围墙花园”的加速转型,版权博弈正在重塑AI训练数据的获取格局。
原文链接:Hacker News





