云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

挪威国家图书馆采用2PB华为全闪存阵列打造主权大模型,破解PB级数据搬运难题

云聚 AI Token Plan 满 199 减 35 元

挪威国家图书馆正利用华为 OceanStor Dorado 全闪存阵列,开发挪威语主权大语言模型(LLM)。鉴于商业 LLM 供应商缺乏对挪威本土历史、新闻和文化的关注,挪威文化部委托该国拥有最大数字馆藏的机构主导此项目。图书馆拥有 20PB 原始数据,经 3-2-1 备份策略后总存储量达 60PB。为了高效训练,项目并未直接使用传统的磁带或磁盘归档系统,而是构建了三阶段处理流程。首先利用 Nvidia DGX H200 系统和华为 2PB 全闪存阵列组成的本地环境,执行高吞吐量的数据摄取、清洗、去重和格式化。随后,处理后的数据被传输至配备 448 个 GPU 的国家级超算 Sigma2 Olivia 系统进行模型训练。IT 负责人 Marius Husnes 指出,目前的行业讨论多集中在算力瓶颈,而忽视了将 PB 级数据从冷存储迁移至热 AI 管道的工程挑战,其团队不得不自行探索解决方案。此外,项目仍面临缺乏标准评估工具、方言处理及数据访问权治理等非技术性挑战。

事件分析

此案例深刻揭示了 AI 训练流程中“存储墙”的真实存在。在行业普遍聚焦 GPU 算力的同时,挪威图书馆的经验表明,数据预处理阶段的 I/O 吞吐量和低延迟同样至关重要。将海量冷数据转化为可供 GPU 消费的热数据,是落地行业大模型的关键工程难题。华为全闪存阵列在此项目中的应用,证明了其在处理高并发、小文件读写场景下的性能优势,有助于其在全球高端存储市场与戴尔、HPE 等厂商竞争。同时,该项目标志着“主权 AI”从概念走向落地,各国开始意识到只有通过本地化训练,才能确保 AI 理解本国的语言细微差别和文化语境。这为科技厂商提供了新的市场机遇:不仅仅是卖算力,更是提供包含数据治理、存储分级和迁移服务在内的全栈解决方案。

💡 核心观点:主权AI时代,数据搬运效率与算力同等重要,高性能全闪存阵列已成为连接文化遗产与人工智能不可或缺的新基建。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 挪威国家图书馆采用2PB华为全闪存阵列打造主权大模型,破解PB级数据搬运难题
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格