网络安全公司 Truffle Security 公布了一项针对 AI 训练数据史无前例的安全审计结果。研究团队扫描了 Hugging Face 上所有的公共数据集,处理了总计 7.6 PB 的数据量(约 1.87 亿个文件)。结果显示,这些开源训练数据中潜伏着巨大的安全隐患:研究人员在 6,003 个数据集中发现了 221,303 个唯一且有效的实时凭证。这些泄露的密钥并非无效的测试数据,而是具备极高权限的“活”凭证,包括大量 GitHub 个人访问令牌(具备代码仓库写入及 CI 工作流修改权限)、云服务商密钥(AWS、GCP)、数据库登录信息以及 OpenAI、Anthropic 等 AI 厂商的 API Key。更令人担忧的是,这些泄露的凭证已广泛污染了主流训练语料库(如 The Stack、Dolma),导致包括 StarCoder、OLMo 在内的知名开源大模型在训练过程中“吸入”了这些敏感信息。研究发现,除了传统的代码仓库泄露,将含有密钥的代码粘贴进聊天助手已成为新的泄露途径,且一个密钥往往会被镜像复制到数千个衍生数据集中,形成难以根除的污染源。
事件分析
💡 核心观点:训练数据的不可逆性使密钥泄露成为永久性隐患,AI 供应链亟需建立“清洁数据”标准。
原文链接:Hacker News





