三星在Hot Chips 2026展示了LPDDR5X-PIM技术,通过在DRAM封装内集成计算单元,实现了614 GB/s的内部带宽,是外部引脚带宽(76.8 GB/s)的8倍,匹敌顶配Apple M5 Max的统一内存带宽。该技术旨在解决AI推理中的“内存墙”瓶颈,实测显示在Llama 3.1 8B模型上推理速度提升至3倍以上。硬件方面,三星采用“地址对齐模式”兼容标准内存控制器,无需重新设计SoC。然而,软件生态面临严峻挑战:主流推理框架(如llama.cpp)的K-quants量化格式无法直接映射到PIM硬件;操作系统缺乏Bank感知的物理内存分配器;且PIM架构擅长GEMV(单Token生成)操作,在GEMM(预填充/批处理)及多Token预测验证中效率受限。尽管硬件已就绪,但大规模应用仍需等待标准化的PIM运行时支持与内核级内存管理器的重构。
事件分析
核心观点:PIM技术通过释放DRAM内部海量带宽打破AI推理“内存墙”,但现有量化格式与内存管理机制的重构是大规模落地的最大阻碍。
原文链接:Hacker News



评论前必须登录!
立即登录 注册