三星在Hot Chips 2026展示了LPDDR5X-PIM技术,通过在DRAM封装内集成计算单元,实现了614 GB/s的内部带宽,是外部引脚带宽(76.8 GB/s)的8倍,匹敌顶配Apple M5 Max的统一内存带宽。该技术旨在解决AI推理中的“内存墙”瓶颈,实测显示在Llama 3.1 8B模型上推理速度提升至3倍以上。硬件方面,三星采用“地址对齐模式”兼容标准内存控制器,无需重新设计SoC。然而,软件生态面临严峻挑战:主流推理框架(如llama.cpp)的K-quants量化格式无法直接映射到PIM硬件;操作系统缺乏Bank感知的物理内存分配器;且PIM架构擅长GEMV(单Token生成)操作,在GEMM(预填充/批处理)及多Token预测验证中效率受限。尽管硬件已就绪,但大规模应用仍需等待标准化的PIM运行时支持与内核级内存管理器的重构。
事件分析
存内计算(PIM)代表了突破冯·诺依曼瓶颈的硬件演进方向。三星方案的关键在于以LPDDR的功耗和成本,提供了接近HBM级别的内部带宽,为边缘设备运行大模型提供了极具性价比的路径。产业层面,该技术直接对标Apple等厂商的大统一内存架构,试图通过内部挖掘而非外部堆叠总线来解决带宽问题。当前的瓶颈已从物理硬件转移至软件栈:现有的量化算法(如GGUF)依赖于通用逻辑运算,而DRAM制造工艺限制了片上逻辑单元的面积,迫使开发者必须重构数据布局和量化方案。未来趋势将侧重于异构计算调度,即在系统中协同调度PIM处理高带宽需求的解码任务,而由NPU/GPU处理高算力需求的预填充任务,这需要编译器和操作系统层面的深度支持。
核心观点:PIM技术通过释放DRAM内部海量带宽打破AI推理“内存墙”,但现有量化格式与内存管理机制的重构是大规模落地的最大阻碍。
原文链接:Hacker News