三星Hot Chips 2026展示LPDDR5X-PIM:存内计算性能强悍但软件适配成噩梦

在 Hot Chips 2026 大会上,三星展示了其最新的 LPDDR5X-PIM(处理内存)技术,旨在通过将计算逻辑直接植入内存芯片来解决“内存墙”瓶颈。该技术在 LPDDR5X 内部集成了 MAC(乘累加)运算单元,利用 DRAM 内部高达 614 GB/s 的惊人带宽进行数据处理,远超外部接口受限制的 76.8 GB/s。三星通过巧妙复用标准 DDR 协议中的行地址指令,实现了 PIM 模式切换,使其能兼容标准内存控制器。实测数据显示,由 8 颗芯片组成的系统可提供约 9.6 INT8 TOPS 的算力,大致匹配 Intel Meteor Lake NPU 的性能。然而,技术分析指出,该技术面临巨大的软件挑战。由于 PIM 模式通过改变内存读写命令的语义来触发计算,且计算结果不经过缓存层级,导致内存必须被标记为“不可缓存”。这使得 CPU 无法使用缓存、预取和乱序执行等核心优化机制,导致常规性能严重受损。此外,PIM 的模式切换是全局性的,无法与普通内存访问并发执行,这意味着在多任务操作系统上进行内存隔离和线程管理将极其复杂,甚至可能需要冻结所有其他线程。

事件分析

三星 PIM 技术展示了从硬件层面突破冯·诺依曼瓶颈的潜力,证明了高带宽内存内部进行 AI 推理计算的可行性。然而,文章深刻揭示了存内计算在通用计算落地中的根本性矛盾:现代 CPU/GPU 架构高度依赖缓存一致性和推测执行来掩盖内存延迟,而 PIM 的副作用读写机制本质上破坏了这些假设。这种架构上的“错配”表明,仅靠物理层的硬件创新是不够的。若想让 PIM 走出专用加速器进入通用计算领域,需要指令集架构(ISA)层面的根本性变革,例如引入专门的内存计算指令和全新的缓存一致性协议,而非仅仅复用现有内存命令。

核心观点:存内计算若要走向通用,必须从指令集架构和操作系统层面重构内存语义,而非仅在硬件层面打补丁。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册