云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

震惊:扫描7.6PB HuggingFace数据竟发现22万个有效密钥,AI供应链面临安全风暴

云聚 AI Token Plan 满 199 减 35 元

网络安全公司 Truffle Security 公布了一项针对 AI 训练数据史无前例的安全审计结果。研究团队扫描了 Hugging Face 上所有的公共数据集,处理了总计 7.6 PB 的数据量(约 1.87 亿个文件)。结果显示,这些开源训练数据中潜伏着巨大的安全隐患:研究人员在 6,003 个数据集中发现了 221,303 个唯一且有效的实时凭证。这些泄露的密钥并非无效的测试数据,而是具备极高权限的“活”凭证,包括大量 GitHub 个人访问令牌(具备代码仓库写入及 CI 工作流修改权限)、云服务商密钥(AWS、GCP)、数据库登录信息以及 OpenAI、Anthropic 等 AI 厂商的 API Key。更令人担忧的是,这些泄露的凭证已广泛污染了主流训练语料库(如 The Stack、Dolma),导致包括 StarCoder、OLMo 在内的知名开源大模型在训练过程中“吸入”了这些敏感信息。研究发现,除了传统的代码仓库泄露,将含有密钥的代码粘贴进聊天助手已成为新的泄露途径,且一个密钥往往会被镜像复制到数千个衍生数据集中,形成难以根除的污染源。

事件分析

此次事件揭示了 AI 训练数据供应链中一个极其隐蔽但危害巨大的盲区:数据的“不可撤销性”与“镜像放大效应”。不同于可以通过强制推送撤销的 Git 历史,一旦敏感密钥进入公共训练语料库,它会被无数次复制、混入衍生数据集并最终固化为模型权重。扫描显示,44% 的泄露密钥出现在多个数据集中,部分来自 The Stack 或 Common Crawl 等上游源头,这种污染具有机械放大的特性。技术上,除了传统的 GitHub 泄露,聊天机器人交互日志已成为新的密钥泄露源头,开发者将含有凭证的代码粘贴给 AI 助手进行调试,导致凭证被捕获并扩散。对于产业而言,这迫使 AI 开发者必须引入“秘密扫描”作为数据清洗的标准前置步骤。未来,开源模型的信誉将不再仅基于性能指标,还需基于其数据集的“卫生”状况,未经审计的公共数据集可能会面临严格的准入限制。

💡 核心观点:训练数据的不可逆性使密钥泄露成为永久性隐患,AI 供应链亟需建立“清洁数据”标准。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 震惊:扫描7.6PB HuggingFace数据竟发现22万个有效密钥,AI供应链面临安全风暴
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型