挪威国家图书馆正利用华为 OceanStor Dorado 全闪存阵列,开发挪威语主权大语言模型(LLM)。鉴于商业 LLM 供应商缺乏对挪威本土历史、新闻和文化的关注,挪威文化部委托该国拥有最大数字馆藏的机构主导此项目。图书馆拥有 20PB 原始数据,经 3-2-1 备份策略后总存储量达 60PB。为了高效训练,项目并未直接使用传统的磁带或磁盘归档系统,而是构建了三阶段处理流程。首先利用 Nvidia DGX H200 系统和华为 2PB 全闪存阵列组成的本地环境,执行高吞吐量的数据摄取、清洗、去重和格式化。随后,处理后的数据被传输至配备 448 个 GPU 的国家级超算 Sigma2 Olivia 系统进行模型训练。IT 负责人 Marius Husnes 指出,目前的行业讨论多集中在算力瓶颈,而忽视了将 PB 级数据从冷存储迁移至热 AI 管道的工程挑战,其团队不得不自行探索解决方案。此外,项目仍面临缺乏标准评估工具、方言处理及数据访问权治理等非技术性挑战。
事件分析
💡 核心观点:主权AI时代,数据搬运效率与算力同等重要,高性能全闪存阵列已成为连接文化遗产与人工智能不可或缺的新基建。
原文链接:Hacker News





