美国超威半导体公司(AMD)于6月15日宣布完成对日本初创企业MEXT的收购。该公司开发的‘预测内存引擎’(Predictive Memory Engine)软件,能在不更换硬件的前提下,使NAND闪存存储层在AI数据中心中承担部分DRAM功能——即以约1/10的单位容量成本,提供接近DRAM的低延迟响应能力。该技术不依赖新型存储介质,而是通过AI驱动的内存访问模式预测与预加载机制实现,已进入与AMD Instinct MI300系列加速器及ROCm软件栈的集成验证阶段。
MEXT总部位于日本东京,核心团队由前东京大学与理化学研究所(RIKEN)系统架构研究人员组成,其技术源于日本文部科学省(MEXT)资助的‘次世代智能内存系统’项目(项目名称与公司名同源)。该公司未量产硬件,全部技术以纯软件形式交付:一套内核级内存管理模块,兼容Linux 5.15+及主流虚拟化环境,支持x86和ARM64平台,并已通过AMD EPYC CPU与MI300X GPU的联合压力测试。关键指标显示,在Llama-2 7B模型推理负载下,启用该引擎后DRAM带宽占用下降37%,而端到端延迟波动控制在±2.1%以内;在Spark实时流分析场景中,冷数据召回延迟从平均8.4ms压降至1.9ms,达到DRAM子系统92%的响应一致性。
该技术并非简单缓存替换,而是重构了传统内存层级逻辑。其核心在于三重协同:第一,运行时持续采集应用层内存页访问序列,构建细粒度访问热图;第二,调用轻量化LSTM模型(参数量<1.2M)实时预测未来200–500ms内最可能被调用的内存页;第三,在OS触发缺页中断前,主动将预测页从NAND闪存预加载至预留的DRAM缓冲区。整个过程对上层应用完全透明——无需修改代码、不改变ABI接口、不增加API调用开销。这意味着客户可在现有服务器上直接部署,无需重写AI框架或调整PyTorch/TensorFlow训练脚本。目前支持的NAND类型包括3D TLC与QLC,最低要求为PCIe Gen4 NVMe SSD,对控制器无特殊指令集依赖。
直击AI数据中心内存成本痛点
当前AI训练与推理集群中,DRAM占整机BOM成本达28–35%(据TrendForce 2024Q1数据),且HBM3等高端内存价格仍处高位。以单台搭载8颗MI300X的服务器为例,若标配2TB HBM3+512GB DDR5,内存成本超11,000美元;而采用MEXT方案后,可将DDR5容量减半至256GB,用2TB NVMe SSD替代部分HBM3带宽需求,整机内存相关成本预计下降19–23%。更重要的是,该方案规避了HBM供应链受限风险——目前全球HBM3产能仍集中于SK海力士与三星,交期普遍超过26周,而企业级NVMe SSD供应稳定,主流厂商如Kioxia、Solidigm、长江存储均具备月产百万片级交付能力。
对中国OEM与IDM厂商的实操提示
中国服务器OEM厂商(如浪潮、中科曙光、华为)若计划导入该技术,需重点关注三点:一是BIOS/UEFI固件需开放内存映射表(E820/EFI memory map)读取权限,以便引擎精准识别DRAM物理地址边界;二是NVMe SSD需启用Host Memory Buffer(HMB)功能并保留至少128MB DRAM作为控制器缓存,否则预加载延迟将劣化40%以上;三是ROCm 6.1+版本为强制依赖项,当前国内多数自研AI芯片平台尚不兼容,需评估迁移适配周期。对长江存储、长鑫存储等国产存储厂商而言,该技术实际提升了QLC NAND在AI基础设施中的商用价值——其每GB成本仅为DRAM的1/12,但此前因写入寿命与随机读延迟被排除在内存池之外,MEXT方案恰好绕过这两大短板,转而放大QLC在顺序读与大块数据吞吐上的优势。
日本市场背景补充:MEXT作为技术源头,反映日本在‘软件定义硬件’路径上的差异化布局。不同于美韩主攻HBM堆叠与存算一体芯片,日本经产省与文部科学省近年联合推动‘内存软优化’专项,资助对象聚焦算法层而非制程,目标是在不突破EUV光刻瓶颈前提下提升现有存储资源效率。此次收购也印证:在AI基建军备竞赛中,内存经济性正从‘硬件堆料’转向‘算法精算’,而中国企业在NVMe固件开发、Linux内核内存子系统调优、以及国产AI芯片与ROCm生态对接方面,已具备快速跟进的技术基底。需注意,该技术尚未通过ISO/IEC 27001信息安全管理认证,金融、政务类高合规要求场景暂不可直接部署。
技术落地层面,AMD明确表示首批商用集成将面向云服务商定制机型,预计2024年Q4起在Azure与Lambda Labs的MI300X集群中开展POC。对国内用户而言,真正价值不在‘替代DRAM’,而在‘延缓DRAM扩容节奏’——当模型参数量年增60%成为常态,能用现有内存支撑多12–18个月的业务增长,就是实打实的成本节约。但必须同步关注两点:一是SSD写入放大率(WAF)在长期高并发预加载下升至3.2,需选用DWPD≥1.5的 enterprise-grade SSD;二是引擎自身占用约1.8% CPU核心资源,对CPU密集型混合负载需预留冗余算力。
