三星存内计算提速3倍,本地运行大模型达81.3词元/秒

发布时间:2026-08-30 05:58  点击:1次
三星存内计算提速3倍,本地运行大模型达81.3词元/秒

韩国三星在2026年热芯片大会展示存内计算技术,将处理单元直接嵌入LPDDR5X内存芯片。实测显示,该方案使本地运行Llama 3.1 8B模型的速度提升至81.3词元/秒,响应时间缩短近半,为端侧AI应用提供全新硬件路径。

硬件架构:打破存算分离瓶颈的降维设计

传统移动终端运行大模型时,算力瓶颈往往不在数学运算,而在数据搬运。每次推理需将权重与激活值从DRAM取出,送往处理器进行矩阵乘法后再写回,此过程消耗绝大部分能耗。三星推出的LPDDR5X-PIM方案改变这一路径。每颗内存芯片内置16个独立计算块,对应DRAM的16个存储库。每个计算块自带专用乘加运算树与寄存器,直接在内存层级完成计算。16个存储库聚合后,内部带宽高达614吉字节/秒,远超传统外部总线的76.8吉字节/秒。单计算块每周期可执行四次INT8或FP8乘加运算,采用4位量化权重时,单芯片吞吐量翻倍至2.4万亿次操作每秒。八颗芯片并行总算力达9.6万亿次操作每秒,性能已接近主流平台神经网络加速器水平。

更具产业意义的是其兼容性设计。该内存芯片未采用新控制协议,严格遵循联合电子工程委员会的561球标准封装。手机与笔记本制造商无需重新设计主板,即可将其作为标准内存直接替换安装。系统只需通过预留的特殊地址行激活计算模式,即可无缝切换,大幅降低下游厂商的硬件改造成本。

市场定位:HBM之外的端侧与边缘计算新路径

三星在发布中明确划定应用边界:该技术并非高带宽内存的竞争者,而是互补品。云端大规模训练场景下,第四代高带宽内存仍凭借超2太字节/秒的堆叠带宽占据主导。人工智能芯片对内存依赖度持续攀升,高带宽内存成本占比已从2024年初的52%飙升至2025年底的63%。成本压力正迅速向消费级产品传导,导致部分笔记本电脑入门机型被迫涨价,智能手机厂商同样面临供应链挤压。

在此背景下,LPDDR5X-PIM的价值凸显。它不追求数据中心级别的吞吐,而是瞄准低功耗、低成本的本地化推理需求。对于需实时响应且对数据隐私要求极高的场景,该架构提供高性价比替代方案。联合电子工程委员会已在四月预告下一代LPDDR6标准将正式纳入存内计算规范,行业路线图显示该技术将在未来两到三年内完成标准化并走向规模化量产。

产业化门槛:软件栈缺失与生态适配挑战

硬件原型已具备商用潜力,但底层软件生态仍是制约落地的核心瓶颈。存内计算模式彻底改变传统命令集语义,导致同一通道无法安全混用常规访问与计算请求。非计算线程可能将有效数据误判为结果,或将激活值写入错误地址。三星目前通过通道级隔离划分计算区域,但这会牺牲非计算进程的有效带宽。计算区域被映射为不可缓存,直接绕过了处理器的缓存优化与乱序执行策略,相当于让系统在内存受限状态下运行。

在多任务操作系统层面,调度器必须在使用计算代码期间禁用中断并锁定其他线程,或通过互斥锁进行串行化处理。若要抢占计算线程,系统需将整个通道退出计算模式、保存所有存储库状态后再恢复。目前主流Linux、Android及Windows内核尚未内置专属钩子函数,操作系统级资源调度仍需重构。对于初创企业与底层软件开发商而言,真正的竞争壁垒在于开发配套运行时环境,包括虚拟内存管理与任务调度器。谁能率先补齐软件栈,谁就能掌握端侧AI推理的底层话语权。

面向中国产业链从业者,建议在三季度内启动针对性布局。全面评估现有算法模型是否支持4至8位低精度量化,若当前流水线强依赖全精度格式,将无法发挥硬件性能。应建立针对80亿参数级别模型的本地推理基准测试体系,以三星公布的81.3词元/秒作为核心对标指标。硬件设计团队需在主板规划阶段预留兼容标准内存插槽的空间,提前验证固件兼容性。随着全球人工智能推理芯片市场规模预计从2025年的177.3亿美元增长至2030年的369.7亿美元,存算一体架构将成为边缘计算设备差异化竞争的关键支点。后续需重点关注下一代内存规范的最终定稿进度,以及主流操作系统内核何时引入原生驱动支持。

深圳市龙岗区鑫万疆再生资源商行

联系人:
王生(先生)
电话:
19146466062
手机:
19146466062
地址:
全国地区回收电子元器件IC芯片
我们发布的其他电子元件/电子配件新闻更多
三星新闻
19146466062 请卖家联系我