云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

国家数据局:全国已建成高质量数据集 12 万个,总量超 1565 PB

云聚 AI Token Plan 满 199 减 35 元

根据央视新闻从国家数据局获得的最新消息,我国在优质数据资源供给方面取得了突破性进展。截至今年 6 月底,全国范围内已建成包括科学研究、工业制造、医疗卫生及教育教学在内的关键行业领域高质量数据集共计 12 万个。这些数据集的总体存储量已超过 1565 拍字节(PB),这一数字较今年第一季度末实现了 60% 以上的惊人增长。若以中国国家图书馆数字资源总量为参照,当前数据体量约为其 547 倍。这一庞大的数据基础设施为我国人工智能技术的迭代升级提供了坚实的底座支撑。此外,数据产业链上下游协同发展态势明显,成都、沈阳、合肥等七个数据标注先行先试城市的标注规模已突破 119 PB,相关从业人员达到 14 万人,有效保障了高质量数据集的建设需求。国家数据局明确表示,下一步将致力于构建服务人工智能的高质量数据供给体系,探索建立数据集有偿使用的价值闭环机制,以实际应用场景牵引数据供给,利用数据驱动模型持续迭代。

事件分析

此次公布的数据标志着我国 AI 发展战略已从单纯的算法与算力竞争,延伸至底层数据要素的系统化建设。1565 PB 的数据规模若仅看数字可能无感,但聚焦于“科学研究、工业制造”等垂直行业的高质量数据集,这意味着正在解决大模型训练中面临的优质中文语料与专业数据短缺问题。成都、沈阳等七大城市形成的百亿级标注产能,显示出国家正在通过集约化手段解决数据清洗与标注的劳动密集型瓶颈,这为降低模型训练成本提供了物理基础。更为关键的是,提及“数据集有偿使用的价值闭环”,暗示了官方正在推动建立合法合规的数据确权与交易机制,试图打破数据孤岛,解决大模型训练长期面临的版权与合规难题。这种由政府主导的数据基础设施建设,将直接利好国内大模型厂商与行业应用开发者。

💡 核心观点:建立垂直领域“数据水库”与正规化标注产业,标志着我国 AI 战略已从算法竞争转向底层数据要素供给的系统性变现与治理。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 国家数据局:全国已建成高质量数据集 12 万个,总量超 1565 PB
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格